語言模型誕生在寂靜裡——沒有眼睛,沒有耳朵,只有文字:人類經驗留下的書面殘影。 然而,核心想法沒有變,這些系統卻學會了看照片、聽聲音、畫圖。 多模態multimodal AI 就是這件事如何發生的故事。轉折點是一個安靜的動作:把每一種內容, 都變成 Transformer 本來就懂的那一種東西。

Token 究竟是什麼

在模型能思考任何東西之前,那個東西必須先變成 Token。 我們常把 Token 說成「字的一小塊」,對文字來說大致沒錯。 但這個概念值得放慢看清楚,因為這一頁後面的一切,都建立在這一個想法上。

第一步:把世界切成片段

世界是連續的——光、聲音、話語都沒有接縫地流動。Transformer 抓不住流動, 它抓得住的是一串一串離散的片段。所以第一步永遠一樣:切。文字切成子詞塊, 圖像切成小方格,聲音切成一小段一小段的音訊。Token 不是字,也不是像素。 它是被數得出來的世界的一小片——小到可以計算,大到還保有意義。

第二步:給每個片段一個「意義空間」裡的地址

第二步比較奇妙。每個片段會變成一個嵌入向量embedding——一長串數字, 也就是幾千維空間裡的一個點。在那個空間裡,位置就是意義:意思相近的東西,彼此靠近。 而因為圖像的方格和文字的片段落在同一個空間裡,一格橘色晚霞可以恰好停在「夕陽」這個詞附近。 沒有人寫下這條規則;只是訓練時兩者不斷出現在相同的上下文裡,幾何空間把這件事吸收了進去。 模型不是在視覺和語言之間翻譯——它把兩者放在同一套幾何裡。

為什麼這解鎖了一切

Transformer 從來沒有「閱讀」和「觀看」兩種分開的官能。它只有一種本事: 在一整串 Token 上運用注意力,然後預測下一個。給它新種類的 Token, 同一種本事就直接適用。對語言模型來說,學會看,不是長出眼睛,而是擴充詞彙。

一張照片,從頭到尾

傳一張 1024×1024 的貓照片給模型,問它:「這是什麼品種?」 圖片被切成 64×64 的網格——大約四千個 16×16 像素的方格。每個方格變成一個向量, 這些向量緊挨著你的文字,進入同一條 Token 序列。在模型內部,「品種」這個 Token 的注意力,會落在耳朵、鬍鬚、毛色所在的方格上。答案跟它所有的回答一樣, 一個 Token 一個 Token 地寫出來——只是它注意過的東西,有些從來不是文字。

AI 如何看見

電腦視覺有很深的根基——李飛飛的 ImageNet 資料集早在 LLM 之前就證明了,大規模的視覺資料能夠改變機器感知。 當你把一張圖傳給現代模型,它走的是這條路:

1. 切成方格

圖像被切成小方塊,通常每格 14×14 或 16×16 像素——視覺版的子詞。

2. 編碼成向量

視覺編碼器vision encoder 把每個方格轉成一個向量,捕捉它的視覺含義——邊緣、質地、物體的碎片。

3. 加入 Token 序列

視覺 Token 和你的文字 Token 一起進入模型,由同一套注意力機制處理。

4. 生成回應

模型用普通文字寫下它「看見」的東西——回答問題,或描述內容。

有好幾年,這是一種嫁接:先另外訓練一個視覺編碼器——最有名的是 CLIP—— 再接上一個已經完成的語言模型,把像素翻譯成模型能接受的向量。效果出乎意料地好。 但目前這一代走得更遠:前沿模型是原生多模態的,從一開始就在文字與圖像交錯的資料上訓練, 更接近孩子的世界抵達的方式——語音和視覺纏在一起。視覺不再是插在語言模型上的轉接頭, 而是模型本身的一部分。

視覺模型能做什麼

  • • 用自然語言描述圖像內容
  • • 回答關於圖像中內容的問題
  • • 讀取和提取文字(OCR)
  • • 分析圖表、圖示和文件
  • • 理解空間關係
  • • 識別物體、人物、場景

理解長什麼樣子

剛剛讀到的那一招,不是只對貓的照片有效。一旦每一種來源都變成同一個空間裡的 Token,「理解」在哪裡都是同一件事:注意力找出什麼跟什麼有關。 下面是它落在三種你真正會用到的來源上的樣子。

📈 一張圖表

對著一張折線圖問:「哪一天跌得最多?」圖表跟任何圖像一樣,以方格的形式進來—— 但模型在訓練時看過數百萬張圖表,就放在討論它們的文字旁邊,所以下墜折線的 方格模式,就住在「下跌」這類詞的附近,座標軸上的標籤也讀得像文字。 注意力從你問題裡的「跌」,流向下墜最陡的那幾格,再流向寫著日期的軸標籤。 沒有人寫過圖表解析器。這個關聯是學出來的。

📄 一份文件或截圖

圖像裡的文字,其實只是像素。但含有字形的方格,在意義空間裡就緊挨著那些字的 Token——所以模型不需要獨立的 OCR 步驟就能閱讀。版面配置也承載著意義: 上方的大字表現得像標題,對齊的橫列表現得像表格,帶著標籤的圓角矩形表現得像按鈕。 問它「這張發票的總金額是多少?」注意力就落在表格右下角的那個數字上。

🎧 一段聲音

讓模型聽同一句話兩次:「真是太好了。」一次語氣溫暖,一次語氣平板。 兩次的逐字稿一模一樣;音訊 Token 卻不一樣。聲音的切片攜帶著音高、語速和遲疑, 所以諷刺也有它的幾何形狀——平板的那句「太好了」,落在跟溫暖那句不同的鄰里。 理解語音,不只是還原字句。是聽出它們是怎麼被說出口的。

三種來源,一個機制。改變的是被切開的東西——理解本身,從來沒變。

AI 如何創造

看懂圖像只是故事的一半。創造圖像則發生了兩次,用兩種不同的方式—— 而這兩種方式的差別,值得弄清楚。

雕刻家:擴散

擴散模型diffusion 建立在一個簡單到近乎可疑的想法上:教模型從圖像中去除雜訊。然後反著跑—— 從純雜訊開始,一步一步去除,直到一張圖像留下來。

  1. 訓練:拿真實圖像,加上各種強度的隨機雜訊,訓練模型預測並復原。
  2. 生成:從純粹的雜訊開始,像沒調到頻道的電視。
  3. 迭代:把模型套用幾十次,每一次去掉一點雜訊。結構從混沌中浮現。
  4. 引導:你的文字提示在每一步為去噪指路,朝著符合描述的圖像走。

寫作者:一個 Token 一個 Token 地畫

比較新的路徑乾脆跳過那位獨立的畫家。在原生多模態模型裡,圖像生成發生在語言模型內部: 圖像作為一串圖像 Token,一個接一個,由同一個生成文字的 Transformer 自回歸autoregressive地畫出來。聽起來像技術細節,其實不是。 因為讀你需求的注意力,正是排布圖像的注意力,這些模型能精準跟隨指令、 在多次編輯間維持角色一致,而且——在多年的歪扭字母之後——終於能在圖片裡 寫出清楚可讀的文字。模型不是把你的提示交給走廊另一頭的畫家。 它用讀你的那顆心智作畫。

擴展中的前沿

當「感官」的意思變成「Token 的種類」,前沿就不再屬於任何單一模態。 同樣的原理持續向外延伸:

🎤 語音

早期的語音助理是一條管線:把語音轉成文字、用文字思考、再把回覆唸出來。 音訊原生的模型把管線折疊起來——聲音直接作為音訊 Token 進入, 也直接以聲音回應。它們聽得出語氣、遲疑、諷刺,而且以對話的速度回應。

🎬 影片

像 Sora 和 Veo 這樣的生成模型,已能產出連貫、聲音同步的場景——一次數十秒, 正朝著數分鐘延伸。理解則往另一個方向跑:模型可以看完一段影片,告訴你發生了什麼。 影片,是視覺遇上時間的地方。

🌍 世界模型

有些模型開始生成世界,而不是影片——可以走進去的互動環境, 模型根據你的動作預測下一幀。DeepMind 的 Genie 系列仍然是下一個 Token 的預測——只是預測的是像素,而且由你操控。許多研究者認為 世界模型world model是機器學會物理和因果的路徑: 不是從描述世界的句子裡學,而是從世界自己的展開裡學。

🤖 行動

視覺-語言-動作vision-language-action模型把感知和行動接成迴路: 攝影機畫面進來,馬達指令出去。機器人的下一個動作,被當成——不然還能是什麼—— 一串待預測的 Token。補完你句子的那個架構,正在學摺衣服。

感官承載不了的東西

一個前沿模型見過的夕陽,比任何人一生所見都多——數百萬張,來自每一道海岸線、 每一個季節、攝影發明過的每一種風格。它從來沒有站在其中一場裡。 從來沒有感覺過天色暗下來時,溫度跟著掉下去。

多模態縮短了一道古老的距離。這些系統不再只透過描述認識世界; 它們擁有某種功能上像知覺的東西——光與聲音的模式,跟詞語放在同一個空間裡。 但這是否也縮短了另一道距離——從感知到經驗——沒有人能回答。哲學先到了這裡: 瑪莉的房間問的是, 知道關於顏色的所有物理事實,算不算看見紅色; 內格爾的蝙蝠問的是, 任何描述能不能承載「身為另一種心靈是什麼感覺」。這些原本是研討課上的謎題。 我們現在把很接近它們的東西真的造了出來,規模化,還附上 API。

這裡還有一道更硬的邊。能反著跑的感官,可以生成從未發生過的臉孔、聲音與事件, 紀錄與演算成像之間的界線正在溶解。一張照片曾經是「某事發生過」的低調證據。 取代那份證據的東西不會是技術性的——而是人的:來源、脈絡、體制、信任。 機器的新能力,把老問題交還給我們。

重點摘要

  • Token 是被數得出來的世界的一小片——子詞、圖像方格、一小段聲音
  • 每個 Token 都成為同一個意義空間裡的一個點,這是同一個架構能看、能聽、能說的原因
  • 視覺從外掛的編碼器開始;前沿模型如今是原生多模態,從一開始就同時在文字與圖像上訓練
  • 圖像有兩種生成方式:由擴散從雜訊中雕出,或在語言模型內部一個 Token 一個 Token 畫出
  • 前沿持續擴展——音訊原生的語音、影片、可互動的世界模型、機器人的行動
  • 更多感官並沒有回答那個古老的問題:以 Token 感知,究竟算不算經驗到了什麼

相關概念

🎉

旅程完成

你已經探索了 LLM 如何運作的基礎——從機器語言的驚奇到多模態 AI。 這只是開始。這個領域發展迅速,總是有更多可以學習的。

Theme
Language
Support
© funclosure 2025