答对笔试
笔试房间
题库
统计
在线编程
行测练习
模考
点数
下载客户端
教程
状态
计算机基础专项练习
/
大模型应用基础
RLHF(基于人类反馈的强化学习)流程中,「奖励模型(Reward Model)」的作用是?
大模型应用基础
A.
自动批量生成训练用的全部问题与参考答案,从而完全替代人工标注
B.
把模型输出翻译成多种语言以扩充数据
C.
用人类偏好排序训练出打分器,在强化学习阶段替代人工给回答打分
D.
检测回答里的语法错误并自动改正