推理服务把多个用户请求合并成一个批(batching)送入 GPU,对吞吐和时延的影响是?

大模型应用基础

  1. A.吞吐和时延同时变好,二者之间不存在取舍,批越大越好
  2. B.吞吐下降但每个请求更快
  3. C.对吞吐和时延都没有任何实际影响,只是让服务端代码更简洁、更易维护
  4. D.吞吐与 GPU 利用率提高,但单个请求可能因等待凑批而时延增加