答对笔试
笔试房间
题库
统计
在线编程
行测练习
模考
点数
下载客户端
教程
状态
计算机基础专项练习
/
大模型应用基础
大模型推理时的 KV Cache 为什么能加速自回归生成?它的代价是什么?
大模型应用基础
A.
缓存前文各层的 K/V,每步只为新 token 计算;代价是显存随序列长度与并发增长
B.
缓存模型权重到显存,避免每次从磁盘加载;代价是启动更慢
C.
缓存用户的历史提问,命中时直接返回上次答案;代价是答案可能过期
D.
缓存 softmax 的结果,使注意力只需算一次;没有任何代价