未登录
FAQ

几十路并发的 AI 会话共用同一只小模型,Xeon Platinum 8568Y+ 的 300MB L3 把权重留在片上,赢面会不会大半落在缓存命中上?

回答

  这个场景里,命中就是赢面。权重整套躺在 300MB L3 内,每个请求都省一次内存往返,48 核 96 线程配合 AMX 把省下的时间直接转成并发吞吐,4GHz 睿频再压住单请求的尾巴。前提卡得很死:模型得小到装得进缓存,溢出 300MB 的权重流照样回落到 8 通道内存去排队。

  跑大量并发小模型推理、又在意延迟的团队,这笔缓存预算花得值;模型动辄上百 GB、权重流远大于缓存的,优势会被摊薄,预算该转向内存与核数。上线前先量工作集和 L3 的贴合度,命中率数字比任何纸面参数都诚实。

Hardware

相关硬件

INTEL

Intel® Xeon® Platinum 8568Y+ Processor

核心数 48 Cores最大 Boost 频率 4.00 GHz三缓 300.00 MBTDP 350.00 W
Compare

相关对比

6 个