核心架構

Transformer

Transformer 一次讀入整個序列——2017 年的這一個架構賭注,成就了之後的一切。

由 Google 的 Vaswani 等人在 2017 年論文「Attention Is All You Need」中提出。早期的循環神經網路(RNN)逐字閱讀文本,吃力地記住之前的內容;Transformer 則透過注意力機制平行處理整個序列。這種平行化使訓練速度大幅提升、長距離的關聯變得可行——如今它驅動著 GPT、Claude、Gemini、Llama 等幾乎所有前沿模型。

比喻:RNN 就像一個字一個字地閱讀一本書,同時試圖記住所有內容。Transformer 則像是把整本書攤開在桌上,讓你能立即看到任意兩段之間的聯繫。
深入:取代循環的是什麼

關鍵一步:Transformer 用自注意力機制取代了循環結構,讓序列中的每個位置都能同時關注其他所有位置。沒有一步步傳遞的隱藏狀態——只有直接的連結,平行計算,層層堆疊。


Attention Mechanism(注意力機制)

注意力讓每個詞去問其他所有詞:此刻你對我有多重要?

一種讓模型在生成每個輸出時,能動態聚焦於輸入中最相關部分的技術。注意力分數決定每個 token 應該對其他 token 產生多大影響——在每一層、每個位置都重新計算。

範例:在 "The cat sat on the mat because it was tired" 中,模型之所以能解析出 "it" 指的是貓,正是因為這兩個 token 之間的注意力分數很高。
深入:Query、Key、Value 與多頭

自注意力把每個 token 轉換為三個向量:

  • Query(查詢)— 我在找什麼?
  • Key(鍵)— 我包含什麼?
  • Value(值)— 我提供什麼資訊?

Multi-head attention:現代 Transformer 使用多個平行的注意力「頭」,每個頭學習不同的關係模式——一個頭可能追蹤句法結構,另一個頭捕捉語義脈絡。例如,GPT-2 每層使用 12 個注意力頭。


Neural Network(神經網路)

神經網路是一層層簡單的算術,疊得夠深之後,加總成任何單一層都不理解的東西。

一種鬆散地受生物神經元啟發的計算系統,由分層組織、彼此互連的節點(人工神經元)構成,用來處理資訊。每個連接都有一個可學習的權重,在訓練過程中不斷調整。現代 LLM 是層數很多的「深度」神經網路——GPT-2 有 12 到 48 個依序堆疊的 Transformer 區塊,資訊在越高的層變得越抽象。

比喻:像一條工廠裝配線,每一站(層)把原料(輸入)加工成越來越精緻的產品——前段處理基本特徵,後段組裝複雜的模式。

Parameters(參數)

參數是學習真正存放的地方——數十億個旋鈕,每個都被微微調整,承載模型所知的一切。

定義 LLM 所學內容的數值權重。每個參數代表網路連接中的一個可調值,在訓練過程中不斷調整,以縮小 loss。更多參數通常意味著更大的學習複雜模式的能力,但透過更好的架構或訓練資料,較少的參數也能達到類似結果。

深入:規模參考表

規模參考:

ModelParameters
GPT-2 (2019)1.5B
GPT-4 (估計)~1.7T
Mixtral 8x7B47B 總計,每個 token 13B 活躍

資料處理

Tokens

Token 不是語言的單位——它是某一個模型家族壓縮方案的單位。

在模型看到你的文字之前,tokenizer 會先把它剁碎:常見詞保持完整,罕見詞成為碎片,有時只剩原始位元組。每個模型家族從自己的訓練資料學出自己的切分規則——所以同一句話在 GPT-2、GPT-4o 或 Llama 3 上的 token 數並不相同。在下方的實驗室親自試試。

比喻:就像不同航空公司的行李規定。旅程是同一趟;怎麼分裝進行李箱——以及要收多少錢——完全取決於你登上誰的飛機。
深入:詞彙表與取捨

更大的詞彙表意味著更短的序列,但嵌入表也更大——這是真實的工程取捨。GPT-2 停在約 5 萬個詞條;GPT-4o 帶著約 20 萬個。英文的粗略經驗法則:1 token ≈ 0.75 個詞。其他語言則完全是另一回事——這正是重點。


Tokenization (BPE & WordPiece)

Tokenization 是一種學來的壓縮:模型看到的片段,是靠統計共現選出來的,不是語言學家決定的。

Byte Pair Encoding(BPE)——原本是一種壓縮演算法,如今是主流的分詞方法(GPT、Llama、DeepSeek 都在用)——從原始位元組開始,反覆合併最常相鄰出現的配對,直到達到目標詞彙量。因為合併規則來自訓練資料,詞彙表也承載了那些資料的偏向:" world" 佔一個 token,「語言」卻碎成位元組。

深入:BPE 與 WordPiece 如何運作

BPE 的迴圈:

  1. 從單一字元(或位元組)開始
  2. 反覆合併最常相鄰出現的配對
  3. 達到目標詞彙量時停止

Byte-level BPE 直接在原始位元組上運作,因此任何文字都能被編碼——最壞情況就是一次一個位元組。

WordPiece(Google 為 BERT 開發)與 BPE 類似,但以似然改善而非單純頻率來選擇合併,並以 ## 標記接續片段:

"playing" → ["play", "##ing"]
"unhappiness" → ["un", "##happi", "##ness"]

為什麼重要:tokenization 直接影響效率與成本。GPT-2 用約 5 萬個 token;GPT-4o 約 20 萬——壓縮率與嵌入表大小之間的取捨,由每個家族自行決定。


GPT-2 / GPT-3 r50k · 2019 · 50,257 vocab 26 tok
bytebytebytebytebytebytebytebytebytebytebytebytebytebytebyte
GPT-4 cl100k · 2023 · 100,264 vocab 13 tok
byte正在bytebyte
GPT-4o / o-series o200k · 2024 · 200,006 vocab 8 tok
模型正在世界
Llama 3 open weights · 2024 · 128,256 vocab 8 tok
模型正在世界
Claude 和 Gemini 在哪裡? 它們目前的 tokenizer 並未公開,所以我們無法誠實地展示它們的切分方式——而這個缺席本身就是課題。Tokenization 不是語言的屬性,而是每個模型家族內部的設計決定,有時甚至是商業機密。當你聽到「context window:200K tokens」時,永遠要問:誰的 token?

所有切分皆為各家族 tokenizer 的真實輸出(gpt-tokenizer 的 r50k / cl100k / o200k 編碼、llama3-tokenizer-js)。虛線方塊是原始位元組——詞彙表無法完整容納的多位元組字元碎片。


Embeddings(嵌入向量)

Embedding 把意義變成幾何——詞成為空間中的點,相似變成距離。

以高維空間中的密集數值向量來表示詞、token 或概念。模型在訓練中學習嵌入,使語義相近的項目聚集在一起。這些向量捕捉的關係非常豐富——不只是相似度,還有類比和層級結構——支撐著語義搜尋、聚類和遷移學習。

經典範例:vector("king") - vector("man") + vector("woman") ≈ vector("queen")。現代嵌入在數千個維度上編碼了更豐富的關係。

Context Window(上下文視窗)

Context window 是模型的工作記憶:它能同時放在心上的一切,多一個 token 都不行。

LLM 可以同時考慮的最大文本量(以 token 計)。更大的視窗能裝下整本書或整個程式碼庫,但注意力的計算成本呈平方成長——而且研究顯示「context rot」:多數模型早在標示上限之前就開始退化,一個 200K 的視窗實務上可能在 130K 左右就不再可靠。

深入:視窗如何成長

Context Window 的演進:

Model年份Context Window
GPT-320204K tokens
GPT-4 Turbo2023128K tokens
Gemini 1.5 Pro20241M tokens
Claude Sonnet 420251M tokens
Llama 42025最高 10M tokens
GPT-5.6 Sol20261.5M tokens

訓練流程

Pre-training(預訓練)

預訓練是一個簡單的遊戲——猜下一個 token——玩上數兆次之後,文法、事實與推理作為副作用湧現。

LLM 學習語言的基礎階段:在大規模文本語料庫上預測下一個 token——書籍、網站、程式碼、論文,共計數千億到數兆個 token。不需要人工標籤;文本本身就是答案卷。

核心洞察:Next-token prediction 看似簡單卻非常強大。為了準確預測,模型必須隱式地學會語法、語義、事實、邏輯關係,甚至近似推理——全部從這一個簡單的目標中湧現,由 loss 來評分。

Loss Function(損失函數) 又稱:cost function、objective

Loss 是模型對真實下一個 token 的驚訝程度——訓練就是數十億次微小的修正,讓這份驚訝變小。

在訓練文本的每個位置,模型為每個可能的下一個 token 分配機率。然後現實揭曉答案。那一刻的 loss 是 −log(p),其中 p 是模型分配給真正出現的那個 token 的機率。自信且正確:loss 趨近於零。自信卻錯誤:巨大的 loss,以及對權重巨大的修正。

"The cat sat on the mat"——模型給了真正的下一個 token 多少機率?
0 2 4 6 25% 50% 75% 100% p(真正的下一個 token) → loss = −ln(p)
0.92nats
p = 40.0%
幾個合理猜測之一。適度的意外,適度的修正。
深入:從一個 token 到一次訓練

Cross-entropy 就是把這份驚訝在語料庫的每個 token 上取平均——數兆個。當論文說模型達到「pre-training loss 2.0」,意思是:平均而言,模型對每個下一個 token 的驚訝程度,相當於它只給了 e−2.0 ≈ 13% 的機率。

這一個數字是 scaling laws 所繪製的、梯度下降所下降的,而且——在近期研究中——比參數量更能預測湧現能力何時出現。這些名字都指向同一件事:loss(錯得多嚴重)、cost(我們付出什麼)、objective(我們優化什麼)。

而 loss 曲線藏著秘密:網路可能長期停在平坦的高原上,然後突然重組、學會泛化——即 grokking 現象。也可以看看核心洞見如何一步步走過這個數字所評分的機率步驟,以及 temperature 如何在生成時重塑同一個分布。


Fine-tuning(微調)

微調讓一個懂語言的模型,學會一份工作。

在特定資料上進行的額外訓練,讓預訓練模型適應特定任務、領域或行為——指令遵循、醫療知識、程式撰寫或組織的特定需求——所需的資料量遠少於預訓練。

深入:常見方法
  • 監督式微調(SFT):在精選範例上訓練
  • 指令微調:在多樣的任務格式上訓練
  • 領域適應:在專門語料上訓練
  • 參數高效方法:如 LoRA,以極少的運算完成微調

RLHF(人類回饋強化學習)

RLHF 教模型人類偏好什麼,而不只是文字如何接續——預測器因此成為助手。

一種以人類判斷(而非預定義獎勵)訓練,使 LLM 與人類偏好對齊的技術。RLHF 把原始語言模型轉變為有用的助手——InstructGPT、ChatGPT 和 Claude 都使用它的變體。它面對的是「對齊」問題:讓 AI 系統做人類真正想要的事情,而不是字面上指定的事情。

深入:流程,以及之後的發展

流程:

  1. 收集人類對模型輸出的比較(哪個回應更好?)
  2. 訓練一個獎勵模型來預測人類偏好
  3. 使用強化學習(通常是 PPO)針對這個獎勵模型優化 LLM

近期發展:

  • RLAIF(AI 回饋)以更少的人工標註達到相當的效果
  • RLTHF 只用傳統標註工作量的 6–7% 就達成完整對齊
  • DPO(直接偏好優化)完全跳過獎勵模型的訓練
  • 現代訓練流程在多輪迭代中結合多種技術

Training Data(訓練資料)

模型是訓練資料的壓縮;放進去什麼,塑造出來的一切。

用來訓練 LLM 的文本語料庫,深刻影響模型的能力與行為。品質和多樣性與規模同等重要——研究顯示,在高品質資料上訓練的較小模型,可以勝過在雜訊較多資料上訓練的較大模型。

深入:典型來源
  • 網頁爬取(Common Crawl)
  • 書籍與文學作品
  • 維基百科
  • 學術論文
  • 程式碼庫(GitHub)
  • 精選的指令資料集

能力與現象

Emergent Capabilities(湧現能力)

湧現能力是沒有人放進去的能力——它們在規模中出現,而我們仍在爭論那躍升是否真實。

在較大模型中突然出現、但在較小模型中不存在的能力——思維鏈推理、上下文學習、多步驟問題解決——這些能力無法透過從較小規模外推來預測。

比喻:就像物理學中的相變——水不會「逐漸有點結冰」。模型獲得能力的方式,可能是內部表示的突然重組,而不是平滑積累。
深入:爭論與證據

科學上的爭論:

觀點論證
湧現是真實的表現在臨界門檻之前徘徊於隨機水準,然後急遽躍升
湧現是海市蜃樓更平滑的指標顯示漸進的改善;表面上的躍升來自非線性的評估選擇

近期發現:

  • 湧現能力可能與 pre-training loss 門檻相關,而不只是參數量
  • o1 這類大型推理模型(LRM)透過強化學習加上推論時搜尋展現湧現能力
  • OpenAI 的 o1 在 Competition Math 拿到 83.3%,GPT-4o 只有 13.4%——暗示真正的轉變,而非測量假象

Hallucination(幻覺)

幻覺是沒有根據的流暢:訓練獎勵自信的猜測,勝過誠實的「我不知道」。

當 LLM 生成流暢且聽起來合理、實際上卻事實錯誤、缺乏依據或完全捏造的內容。近期研究把它理解為系統性的激勵問題:基準測試懲罰「我不知道」,模型於是學會虛張聲勢。

真實世界的影響:Mata v. Avianca(2023)一案中,一位律師因提交含有 ChatGPT 捏造判例引用的訴狀而遭到懲戒。
深入:類型、成因與緩解

類型:

  • 內在幻覺:與提供的上下文中的資訊相矛盾
  • 外在幻覺:編造任何來源中都沒有的、無法驗證的資訊

緩解策略:

策略成效
思維鏈提示在對提示敏感的情境中減少 50% 以上的幻覺
檢索增強生成(RAG)以外部知識為回應定錨(但非萬靈丹)
校準感知的獎勵訓練獎勵恰當的不確定性
片段級驗證根據知識庫驗證主張

Inference(推論)

推論是模型的工作現場:一次一個 token,每一個都以之前的一切為條件。

從訓練好的模型生成輸出的過程——也就是你與 AI 對話時發生的事。你的輸入經過模型的每一層;token 一次生成一個(自迴歸生成),每個新 token 都以之前的一切為條件。推論成本——運算、延遲、金錢——是部署時的重要現實考量。


Multimodal(多模態)

多模態模型把影像、聲音與影片翻譯成與文字相同的內在語言——同一個意義空間,許多扇門。

能處理和生成多種內容——文字、圖像、音訊、影片——的 AI 系統,且經常在同一次互動中完成。這需要專門的編碼器(如視覺 Transformer)把非文字輸入轉換成語言模型能運用的表示。

深入:例子
  • GPT-4o(「omni」):在單一架構中統一文字、圖像和音訊
  • Gemini 2.5:處理文字、圖像、音訊和影片,原生支援 1M+ token 上下文
  • Claude 3+:在對話中分析圖像
  • DALL-E 3、Stable Diffusion、Midjourney:從文字生成圖像
  • Sora:使用擴散從文字生成影片

生成控制

Temperature(溫度)

Temperature 不會讓模型變聰明或變笨——它決定你能看見多少模型自身的不確定性。

Temperature 為 0 時,模型永遠選出機率最高的那個 token:可重現、謹慎、有時乏味。溫度越高,機率較低的 token 也有機會出線:更多變、更令人驚喜,最終失去連貫。分布一直都在——temperature 是決定採樣多忠實地尊重它的旋鈕。

深入:設定與機制
Temperature行為使用場景
0.0確定性,最可能的 token事實問答、程式碼生成、結構化輸出
0.3–0.5平衡一般用途任務
0.7–1.0創意、多樣創意寫作、腦力激盪、多樣化選項
>1.0高度隨機實驗性,可能變得不連貫

機制上:temperature 在 softmax 之前除以 logits(原始分數)——低值讓分布更尖銳地集中於最高的 token,高值讓它更平坦。它重塑的,正是訓練時由 loss 評分的同一個分布。


Top-p(Nucleus Sampling)

Top-p 把候選名單裁到最小的、值得認真考慮的集合——top-k 是固定的,它是自適應的。

一種採樣方法:只考慮累積機率超過門檻 p 的最小 token 集合。與固定候選數量的 top-k 不同,top-p 會隨當下的情勢調整。

範例:top-p = 0.9 時,從佔前 90% 機率質量的 token 中採樣。若一個 token 獨佔 95%,就只考慮它;若最高者只佔 40%,許多候選都能入選。常與 temperature 搭配使用——常見設定為 temperature 0.7、top-p 0.9。

架構與模型

Vision Encoder(視覺編碼器)

Vision encoder 把影像切成小塊、當作 token 對待——視覺被翻譯成 transformer 的文法。

把圖像轉換成語言模型能理解的嵌入的元件。視覺 Transformer(ViT)把圖像切成方格——視覺版的 token——再經過與文字相同的 Transformer 機制處理。

深入:處理流程
  1. 圖像切成固定大小的方格(例如 16×16 像素)
  2. 每個方格嵌入為一個向量
  3. 加上位置編碼
  4. 經過 Transformer 層處理
  5. 輸出表示與語言模型整合

Diffusion Models(擴散模型)

擴散模型學會逆轉毀壞:從純雜訊開始,一步步減去它,圖像便浮現。

一種透過學習「逐漸添加雜訊」的逆過程來生成圖像(以及越來越多影片)的技術。訓練:模型學習逐步去噪。生成:從純雜訊開始,在文字提示的引導下迭代細化成連貫的圖像。

比喻:就像雕塑家從一塊粗糙的大理石(雜訊)開始,逐漸雕刻以揭示雕像(圖像),文字提示則作為藍圖。
深入:關鍵模型
  • DALL-E 3(OpenAI):文字轉圖像,與 ChatGPT 整合
  • Midjourney:以藝術風格化輸出聞名
  • Stable Diffusion 3(2024):開源,使用 Transformer
  • Sora(2024):將擴散擴展到影片生成

快速參考: Model Context Windows (2026)

前沿已收斂於一百萬 token——差異化如今發生在別處。(別忘了:這些都是各家族自己的 token。)

ModelContext Window備註
GPT-5.6 Sol1.5MOpenAI 旗艦——max reasoning 與 ultra subagent 模式
Claude Fable 51MAnthropic 最強的公開可用模型
Claude Opus 4.81M長時程代理式編碼
Gemini 3.1 Pro1M推理能力翻倍,為代理式工作流設計
Muse Spark 1.11MMeta 首個開放開發者建構的 Muse 模型(Meta Model API)
DeepSeek-V4-Pro1M前沿 MoE,開放權重(MIT)
Grok 4.5500KV9 基礎上的編碼/代理旗艦
GLM-5.21M長時程編碼最強開源模型,MIT 授權

最後更新:2026 年 8 月

研究資料來源包括 arXiv 調查、同行評審出版物和行業文獻,包括:「大型語言模型中的湧現能力:調查」(2025)、「大型語言模型幻覺:綜合調查」(2025)、Hugging Face 文檔和模型技術報告。

探索學習之旅 →
Theme
Language
Support
© funclosure 2025