RLHF(基于人类反馈的强化学习)流程中,「奖励模型(Reward Model)」的作用是?

大模型应用基础

  1. A.自动批量生成训练用的全部问题与参考答案,从而完全替代人工标注
  2. B.把模型输出翻译成多种语言以扩充数据
  3. C.用人类偏好排序训练出打分器,在强化学习阶段替代人工给回答打分
  4. D.检测回答里的语法错误并自动改正