出力的是 AMX,卡进度的是内存和 I/O。打分是成批的短矩阵运算,AMX 一开,48 核 96 线程的 bf16/int8 吞吐被明显抬升,4GHz 睿频让每段文本的处理时间压得很短;可语料要从存储读进来、结果要写回去,260MB L3 只装得下权重的一角,盘和带宽往往先到顶。
有海量离线打分需求的团队,按吞吐买它就对了;交互式单请求的活,用不着把 48 核全叫醒。跑之前把批处理框架切到 bf16/int8,确认 AMX 路径真的生效——指令集没吃到,核数再足也白搭。