换了会话还只要 0.45 秒:你测的冷启动真的冷吗?
一次本地模型缓存实验:新会话复用了全部 3633 个输入 token,负对照却被我判成通过。换会话 ID 为什么隔离不了缓存,以及怎样检查加速数字的分母。
LLM · benchmarking · caching9 min 阅读一次本地模型缓存实验:新会话复用了全部 3633 个输入 token,负对照却被我判成通过。换会话 ID 为什么隔离不了缓存,以及怎样检查加速数字的分母。
LLM · benchmarking · caching9 min 阅读我在笔记里写下「四并发聚合约 350 tok/s,continuous batching 真有效」,第二天拆开完成时间一看,四条请求一条接一条排队,聚合吞吐 91.2。这篇讲怎么用一个除法和一张完成时间表,一眼分出「真并行」和「排队排得很整齐」,顺带算清楚单流 98 tok/s 到底离物理天花板还有多远。
llm · benchmark · apple-silicon14 min 阅读一条公开跑分声称单张消费卡上 27B 稠密模型跑到 2103.6 tok/s。我没有那张卡,也没跑过那个配置,但三个除法就能确定它全程没做过前向计算。这三个除法你在自己机器上也能算。
llm · benchmark · inference14 min 阅读