现代大语言模型技术体系梳理
现代大语言模型技术体系梳理
1. 大语言模型整体架构
现代 LLM 系统通常可以分为四个层次:
| 层级 | 作用 | 典型技术 |
|---|---|---|
| 模型基础 | 学习语言和知识 | Transformer、Attention |
| 模型训练 | 提升能力和对齐 | Pre-training、Post-training |
| 模型优化 | 降低训练和部署成本 | LoRA、QLoRA、Quantization |
| 应用系统 | 构建实际产品 | RAG、Agent、Memory |
2. 模型基础架构
2.1 Transformer
Transformer 是目前主流大语言模型的基础架构。
代表模型:
- GPT
- LLaMA
- Qwen
- DeepSeek
Transformer 主要由:
- Embedding
- Attention
- Feed Forward Network
- Layer Normalization
组成。
2.2 Attention(注意力机制)
Attention 是 Transformer 的核心机制。
它解决的问题:
模型如何判断输入文本中哪些信息更加重要。
例如:
小明告诉小红,她喜欢AI。模型需要判断:
“她”对应谁。
Attention 通过:
- Query
- Key
- Value
计算不同 token 之间的关联程度。
2.3 Dense 与 MoE
Dense Model
传统稠密模型。
特点:
所有参数都会参与计算。
例如:
7B模型:
每次推理都会激活全部70亿参数。
MoE(Mixture of Experts)
混合专家模型。
核心思想:
使用路由机制选择部分专家参与计算。
优势:
可以拥有更大的参数规模,同时降低计算成本。
代表:
- Mixtral
- DeepSeek-V3
3. 模型训练流程
3.1 Pre-training(预训练)
预训练是大模型的第一阶段。
目标:
让模型学习:
- 语言规律
- 世界知识
- 基础推理能力
主要任务:
预测下一个 Token。
例如:
输入:
中国的首都是
模型预测:
北京
3.2 Post-training(后训练)
预训练后的模型虽然具备语言能力,但是还不是一个优秀助手。
因此需要后训练。
Post-training 包括:
- SFT
- RLHF
- DPO
- RLVR
3.2.1 SFT(Supervised Fine-Tuning)
监督微调。
通过人工整理的数据:
用户问题 → 标准答案让模型学习:
- 指令遵循
- 输出格式
- 角色风格
例如:
角色 AI:
输入:
你是谁?
输出:
我是某某角色。
3.2.2 RLHF
Reinforcement Learning from Human Feedback。
基于人类反馈强化学习。
流程:
- 模型生成多个答案
- 人类评价答案质量
- 训练奖励模型
- 使用强化学习优化模型
目标:
让模型更加符合人类偏好。
3.2.3 DPO
Direct Preference Optimization。
直接偏好优化。
相比 RLHF:
不需要单独训练奖励模型。
通过:
优质回答
+
较差回答直接优化模型。
3.2.4 RLVR
Reinforcement Learning with Verifiable Rewards。
可验证奖励强化学习。
奖励来自:
- 数学答案是否正确
- 代码是否通过测试
而不是人工评价。
常用于:
- 数学推理
- 编程能力提升
4. 模型微调与优化
4.1 Fine-tuning(微调)
在已有模型基础上继续训练。
主要方式:
- Full Fine-tuning
- LoRA
- QLoRA
4.2 LoRA
Low-Rank Adaptation。
一种参数高效微调方法。
核心:
不修改原模型参数。
增加一个小型适配层。
优势:
- 显存需求低
- 训练速度快
- 适合个人开发
4.3 QLoRA
Quantized LoRA。
结合:
- 模型量化
- LoRA微调
典型流程:
FP16模型
↓
4bit量化
↓
LoRA训练适合消费级显卡。
4.4 Quantization(量化)
量化用于降低模型大小。
常见:
- FP32
- FP16
- INT8
- INT4
例如:
7B模型:
FP16:
约14GB显存
INT4:
约4GB显存
代价:
一定程度降低精度。
5. 大模型应用工程
5.1 Token
Token 是模型处理文本的基本单位。
模型训练规模通常使用:
参数量 + Token数量衡量。
5.2 Embedding
Embedding 将文本转换为向量。
例如:
人工智能
↓
[0.23,0.52,...]用于:
- 搜索
- 推荐
- RAG
5.3 RAG
Retrieval Augmented Generation。
检索增强生成。
解决:
模型不知道外部知识。
流程:
- 文档向量化
- 存入向量数据库
- 用户提问
- 检索相关内容
- 输入模型生成答案
应用:
- 企业知识库
- 私人助手
- 角色AI
5.4 Prompt Engineering
提示词工程。
通过设计 Prompt 控制模型行为。
特点:
- 不修改模型参数
- 成本低
- 快速验证
5.5 Memory
AI记忆系统。
分为:
Short-term Memory
短期记忆:
当前上下文。
Long-term Memory
长期记忆:
数据库保存用户信息。
通常结合:
- 数据库
- RAG
5.6 Agent
智能体。
让模型具备:
- 规划
- 调用工具
- 执行动作
基本流程:
目标
↓
规划
↓
调用工具
↓
观察结果
↓
继续行动例如:
AI程序员:
- 阅读需求
- 编写代码
- 运行测试
- 修改代码
6. AI系统工程
6.1 Harness
Harness 指围绕模型构建的系统框架。
包含:
- Prompt管理
- Memory
- 工具调用
- 状态管理
- 安全控制
例如:
角色AI:
LLM
+
Persona
+
Memory
+
Harness6.2 Persona Knowledge
人格知识。
用于角色AI。
包含:
- 身份背景
- 性格特点
- 语言风格
- 行为规则
- 人际关系
通常结合:
Persona资料
↓
RAG
↓
Prompt
↓
LLM总结
现代 LLM 技术体系:
基础模型
Transformer
Attention
MoE
训练
Pre-training
Post-training
SFT
RLHF
DPO
RLVR
优化
LoRA
QLoRA
Quantization
应用
Embedding
RAG
Prompt
Memory
Agent
系统
Harness
Persona
Tool Calling理解这套体系后,可以阅读大部分现代大模型论文、项目架构和 AI 产品技术方案。
