极库未登录
极库这个场景里,命中就是赢面。权重整套躺在 300MB L3 内,每个请求都省一次内存往返,48 核 96 线程配合 AMX 把省下的时间直接转成并发吞吐,4GHz 睿频再压住单请求的尾巴。前提卡得很死:模型得小到装得进缓存,溢出 300MB 的权重流照样回落到 8 通道内存去排队。
跑大量并发小模型推理、又在意延迟的团队,这笔缓存预算花得值;模型动辄上百 GB、权重流远大于缓存的,优势会被摊薄,预算该转向内存与核数。上线前先量工作集和 L3 的贴合度,命中率数字比任何纸面参数都诚实。