大语言模型原理
什么是 LLM
大语言模型(Large Language Model)是基于 Transformer 架构、在海量文本数据上训练的神经网络模型,能够理解和生成自然语言。
关键组件
- Self-Attention 机制:让模型理解词与词之间的关系
- 位置编码:保留序列中的位置信息
- 前馈网络:对注意力输出进行非线性变换
- 层归一化:稳定训练过程
Encoder-Decoder 结构
| 模型类型 |
代表 |
特点 |
| Encoder-only |
BERT |
擅长理解/分类 |
| Decoder-only |
GPT, LLaMA |
擅长生成 |
| Encoder-Decoder |
T5, BART |
擅长翻译/摘要 |
训练流程
预训练 (Pre-training)
→ 有监督微调 (SFT)
→ 人类反馈强化学习 (RLHF/DPO)
- 预训练:在万亿 token 上学习语言模式
- SFT:用高质量对话数据微调
- RLHF/DPO:对齐人类偏好
关键概念
- Token:模型处理的最小单位(约0.75个英文单词)
- Context Window:模型一次能处理的最大 token 数
- Temperature:控制输出随机性(0=确定性,1=更随机)
- Hallucination:模型编造不存在的信息
主流模型对比
| 模型 |
厂商 |
特点 |
| GPT-4o |
OpenAI |
综合能力强 |
| Claude 4 |
Anthropic |
长文本、安全性 |
| Gemini 2 |
Google |
多模态 |
| DeepSeek V3 |
DeepSeek |
开源、性价比 |
| LLaMA 4 |
Meta |
开源标杆 |
相关笔记