Transformer 架构
一、背景:为什么需要 Transformer?
| 技术 | 核心思路 | 主要缺陷 |
|---|---|---|
| N-gram | 统计前面几个词,预测下一个词 | 无语义理解能力 |
| 词向量 (Word Embedding) | 将词映射为高维数字,语义相近的词距离近 | 本身不做预测 |
| 前馈神经网络 (FFN) | 用神经网络学习语言规律 | 只能处理固定长度,远距离信息丢失 |
| RNN | 引入隐藏状态传递记忆 | 长期记忆能力差,远距离信息易丢失 |
| LSTM | 增加长期记忆通道和门控机制 | 必须串行计算,效率低;远距离信息仍需逐层传递 |
核心痛点:两个距离很远的 Token(如"虎皮鹦鹉"和"那只")交换信息,必须经过中间所有 Token 一步步传话,效率低且信息易衰减。