3. Transformer: 革命性的變化

*註 以下內文圖片皆出自於Recurrent Neural Networks (RNNs): A gentle Introduction and Overview這篇論文

Attention 的出現,讓 Decoder 獲得了『動態回頭看』的超能力。但這時候的 Attention 依然只是 RNN 的輔助外掛——Encoder 和 Decoder 的底層還是得靠 LSTM 一個字一個字排隊吞吐。

直到 2017 年,Google 的團隊一不做二不休,提出了一個史無前例大膽的想法:『既然 Attention 這麼強,我們幹嘛還要大費周章地用 RNN 傳話?直接把 RNN 徹底拔掉,全身上下 100% 只用 Attention 來蓋模型不就得了?』

這篇史詩級論文的標題就叫 《Attention Is All You Need》,而它催生出的終極怪物,就是統治了當今大模型時代的霸主——Transformer


Transformer

說真的我寫到這我真的越來越興奮(?),有種親眼見證歷史的感覺,不得不佩服google的研究人員真的厲害啊 !

為什麼一步步講到 Transformer 會越來越興奮呢,你必須明白它徹底顛覆了兩件事:

1. 降維打擊:從「排隊加工」到「全域平行運算(Parallelism)」

如果是使用RNN,當你想讓 AI 讀完一整本三國演義(或你的管理學筆記),RNN 必須讀完第 1 個字,才能算第 2 個字;算完第 2 個字,才能算第 3 個字。你的頂級 GPU 顯示卡只能乾瞪眼,因為它一次只能幫你算一個字。

而Transformer利用 Self-Attention(自注意力機制),直接把一整篇文章(成千上萬個字)一次性全部平行倒進顯示卡裡!就像一間餐廳直接僱用了一萬個戈登同時進場,每個人負責看一個字,並且能在微秒內跟其他所有人交換眼神(矩陣相乘)。訓練速度直接飆升了幾百倍!

2. 空間傳送門:從「長途傳話」到「天涯若比鄰」

在 RNN 裡,第 1 個字想要跟第 100 個字產生關聯,誤差訊號必須無盡地走過 100 個時間步(所以才有梯度消失問題)。但在 Transformer 裡,利用 Q, K, V 的矩陣運算,第 1 個字和第 1000 個字之間的距離永遠是 O(1)(只要一小步就能相連)。它打破了時間和空間的物理限制,長距離失憶症被徹底根治。


Transformer 三大核心技術

為了在沒有 RNN 的情況下還能認得文字的因果關係,Transformer 裝備了三個史詩級的架構:

1. 位置編碼(Positional Encoding)

既然字是一次性全部倒進去,AI 要怎麼知道誰在前面、誰在後面?(例如:「狗咬人」「人咬狗」 倒進去矩陣長得一模一樣)。

  • 黑科技解法: 科學家不靠循環網路,而是利用數學上的正弦與餘弦波(Sine and Cosine waves),幫每個字印上一個「絕對時空坐標軸(時鐘標記)」,然後直接加進字的 Embedding 裡。AI 一看坐標,瞬間秒懂誰先誰後!

2. 自注意力機制(Self-Attention)與多頭注意力(Multi-Head Attention)

這就是上一篇學到的 Q, K, V 升級版。以前是 Decoder 去看 Encoder;現在是文章裡的每一個字,自己回頭去跟這篇文章裡的其他所有字看對眼!

  • 文字演示: 讀到句子 「這隻貓太胖了,因為牠吃了太多魚。」
  • 當 AI 在處理 「牠」 這個字時,「牠」 作為 Query 出動,去跟整句話所有的字 Key 算關聯度。結果發現 「貓」 的分數最高。於是,「牠」Value 就被深深注入了 「貓」 的靈魂。
  • 多頭(Multi-Head): 更扯的是,它不只看一次!它把大腦拆成 8 個或 16 個「注意力頭(Heads)」,一頭負責抓主謂賓、一頭負責抓形容詞、一頭負責抓情感。

3. 殘差連接與層歸一化(Residual Connection & LayerNorm)

這就是後來大模型(LLM)能疊到 100 多層(DRNN 望塵莫及的深度)的秘密通道。它在每一層注意力之間蓋了「安全逃生梯(殘差直通車)」,讓梯度在反向傳播時,可以毫無損耗地直達地心,確保模型再大、再深都不會練爛。


Transformer 的誕生,徹底解放了算力的枷鎖。

因為它支援完美的平行運算,科學家們終於可以把整個網際網路的資料(維基百科、GitHub 程式碼、全人類的電子書)一股腦地全部塞進去餵給它。反正顯示卡塞得越多,它就跑得越快!

這尊由 Attention 鑄造而成的巨獸,隨後分化出了三大陣營:

  1. 專精理解的左手:BERT(純 Encoder 架構)
  2. 專精生成的右手:GPT(純 Decoder 架構)
  3. 完美翻譯的雙手:T5(完整的 Encoder-Decoder)

人類歷史上最強大的 LLM 大航海時代,至此拉開序幕。下一次,我們就將正式聊聊那個以一己之力改變世界的怪物——GPT(Generative Pre-trained Transformer) 的前世今生。