监督微调(SFT,Supervised Fine-Tuning)阶段使用的训练数据形态通常是?

大模型应用基础

  1. A.海量无标注的纯网页文本语料,与预训练阶段用同一份数据
  2. B.同一提示下两个候选回答的「哪个更好」人工偏好对
  3. C.只收集用户的提问、不含任何参考答案的问题集合
  4. D.「指令 / 提问 → 期望回答」的成对样本