Tokens
LLM 處理的基本文本單位——在詞彙量大小和序列長度之間取得平衡的子詞塊。現代分詞器不使用完整的詞或單個字元,而是將文本分割成有意義的子單位。這種方法通過將罕見詞拆分成熟悉的片段來處理,同時保持常見詞完整。
🔗 範例: "unhappiness" 可能被分詞為 ["un", "happi", "ness"]。"Hello, world!" 通常變成 4 個 token:["Hello", ",", " world", "!"]。GPT-4 使用約 100,000 個 token 的詞彙表;在英文中大約 1 個 token ≈ 0.75 個詞。
Embeddings(嵌入向量)
以高維空間中的密集數值向量來表示詞、Token 或概念。模型在訓練中學習嵌入,使語義相近的項目聚集在一起。這些向量捕捉的關係非常豐富——不只是相似度,還有類比和層級結構。
🔗 經典範例: vector("king") - vector("man") + vector("woman") ≈ vector("queen")。現代嵌入在數千個維度上編碼了更豐富的關係,支撐語義搜尋、聚類和遷移學習。
Context Window(上下文視窗)
LLM 可以同時考慮的最大文本量(以 token 計)。這定義了模型在單次互動中擁有多少「記憶」。更大的視窗能夠處理整本書、整個程式碼庫或長對話,但隨著注意力機制的平方增長而增加計算成本。
Context Window 的演進:
Model 年份 Context Window GPT-3 2020 4K tokens GPT-4 Turbo 2023 128K tokens Gemini 1.5 Pro 2024 1M tokens Claude Sonnet 4 2025 1M tokens Llama 4 2025 最高 10M tokens