Transformer 为什么必须额外引入位置编码(Positional Encoding)?

大模型应用基础

  1. A.因为词嵌入的维度不够,需要用位置编码把维度补齐后才能与权重矩阵做矩阵乘法
  2. B.因为 GPU 只能处理带位置标签的张量,没有位置编码的输入在硬件层面就无法完成矩阵运算
  3. C.为了让模型能够区分大小写和标点
  4. D.因为自注意力对输入顺序置换不变,模型本身感知不到 token 的先后