答对笔试
笔试房间
题库
统计
在线编程
行测练习
模考
点数
下载客户端
教程
状态
计算机基础专项练习
/
大模型应用基础
推理服务把多个用户请求合并成一个批(batching)送入 GPU,对吞吐和时延的影响是?
大模型应用基础
A.
吞吐和时延同时变好,二者之间不存在取舍,批越大越好
B.
吞吐下降但每个请求更快
C.
对吞吐和时延都没有任何实际影响,只是让服务端代码更简洁、更易维护
D.
吞吐与 GPU 利用率提高,但单个请求可能因等待凑批而时延增加