Skip to Content

📄 大语言模型原理

大语言模型原理

什么是 LLM

大语言模型(Large Language Model)是基于 Transformer 架构、在海量文本数据上训练的神经网络模型,能够理解和生成自然语言。

核心架构:Transformer

关键组件

  • Self-Attention 机制:让模型理解词与词之间的关系
  • 位置编码:保留序列中的位置信息
  • 前馈网络:对注意力输出进行非线性变换
  • 层归一化:稳定训练过程

Encoder-Decoder 结构

模型类型 代表 特点
Encoder-only BERT 擅长理解/分类
Decoder-only GPT, LLaMA 擅长生成
Encoder-Decoder T5, BART 擅长翻译/摘要

训练流程

预训练 (Pre-training)
  → 有监督微调 (SFT)
    → 人类反馈强化学习 (RLHF/DPO)
  1. 预训练:在万亿 token 上学习语言模式
  2. SFT:用高质量对话数据微调
  3. RLHF/DPO:对齐人类偏好

关键概念

  • Token:模型处理的最小单位(约0.75个英文单词)
  • Context Window:模型一次能处理的最大 token 数
  • Temperature:控制输出随机性(0=确定性,1=更随机)
  • Hallucination:模型编造不存在的信息

主流模型对比

模型 厂商 特点
GPT-4o OpenAI 综合能力强
Claude 4 Anthropic 长文本、安全性
Gemini 2 Google 多模态
DeepSeek V3 DeepSeek 开源、性价比
LLaMA 4 Meta 开源标杆

相关笔记