大模型推理时的 KV Cache 为什么能加速自回归生成?它的代价是什么?

大模型应用基础

  1. A.缓存前文各层的 K/V,每步只为新 token 计算;代价是显存随序列长度与并发增长
  2. B.缓存模型权重到显存,避免每次从磁盘加载;代价是启动更慢
  3. C.缓存用户的历史提问,命中时直接返回上次答案;代价是答案可能过期
  4. D.缓存 softmax 的结果,使注意力只需算一次;没有任何代价