Decoder-only 大模型在训练时使用「因果掩码(causal mask)」,它的作用是?

大模型应用基础

  1. A.屏蔽掉训练数据里的敏感词与有害内容,避免模型在预训练阶段学到不当的表达方式
  2. B.让位置 t 只能关注 t 及之前的 token,与推理时逐个生成的方式一致
  3. C.随机遮住一部分 token 让模型做填空预测,与 BERT 的 MLM 掩码做法相同
  4. D.把 padding 位置的注意力权重置零