极库未登录
极库圈住一批“小而热”的模型与索引刚刚好:embedding、打分、重排这类请求每个只碰几 MB 数据,却要成百上千并发,60 核 120 线程把并发摊平后,300MB L3 让高频命中的权重留在片上,8 通道最高 4096GB 再兜住全部冷数据。轻量服务的工作集几乎不再出缓存,这是它吞吐好看的直接原因。
搜广推链路里的向量召回与精排打分,拿它当 CPU 底座很对路;长文本生成这类要吃满带宽与容量的活,300MB 圈不下也兜不住,该交给带宽更大的兄弟款。压测时盯着 L3 命中率调 batch,命中率上去,这 300MB 才算是花对了地方。