Gellow 旋转头像
One Summer's Day
钢琴 · 轻音乐
0:000:00
随机遍历 · 6 首
Insert Coin To Load
M
Loading Markdown

正在渲染文章与目录。

markdown / full reading page

LLM

现代大语言模型技术体系梳理

现代大语言模型技术体系梳理

1. 大语言模型整体架构

现代 LLM 系统通常可以分为四个层次:

层级作用典型技术
模型基础学习语言和知识Transformer、Attention
模型训练提升能力和对齐Pre-training、Post-training
模型优化降低训练和部署成本LoRA、QLoRA、Quantization
应用系统构建实际产品RAG、Agent、Memory

2. 模型基础架构

2.1 Transformer

Transformer 是目前主流大语言模型的基础架构。

代表模型:

  • GPT
  • LLaMA
  • Qwen
  • DeepSeek

Transformer 主要由:

  • Embedding
  • Attention
  • Feed Forward Network
  • Layer Normalization

组成。


2.2 Attention(注意力机制)

Attention 是 Transformer 的核心机制。

它解决的问题:

模型如何判断输入文本中哪些信息更加重要。

例如:

小明告诉小红,她喜欢AI。

模型需要判断:

“她”对应谁。

Attention 通过:

  • Query
  • Key
  • Value

计算不同 token 之间的关联程度。


2.3 Dense 与 MoE

Dense Model

传统稠密模型。

特点:

所有参数都会参与计算。

例如:

7B模型:

每次推理都会激活全部70亿参数。


MoE(Mixture of Experts)

混合专家模型。

核心思想:

使用路由机制选择部分专家参与计算。

优势:

可以拥有更大的参数规模,同时降低计算成本。

代表:

  • Mixtral
  • DeepSeek-V3

3. 模型训练流程

3.1 Pre-training(预训练)

预训练是大模型的第一阶段。

目标:

让模型学习:

  • 语言规律
  • 世界知识
  • 基础推理能力

主要任务:

预测下一个 Token。

例如:

输入:

中国的首都是

模型预测:

北京


3.2 Post-training(后训练)

预训练后的模型虽然具备语言能力,但是还不是一个优秀助手。

因此需要后训练。

Post-training 包括:

  • SFT
  • RLHF
  • DPO
  • RLVR

3.2.1 SFT(Supervised Fine-Tuning)

监督微调。

通过人工整理的数据:

用户问题 → 标准答案

让模型学习:

  • 指令遵循
  • 输出格式
  • 角色风格

例如:

角色 AI:

输入:

你是谁?

输出:

我是某某角色。


3.2.2 RLHF

Reinforcement Learning from Human Feedback。

基于人类反馈强化学习。

流程:

  1. 模型生成多个答案
  2. 人类评价答案质量
  3. 训练奖励模型
  4. 使用强化学习优化模型

目标:

让模型更加符合人类偏好。


3.2.3 DPO

Direct Preference Optimization。

直接偏好优化。

相比 RLHF:

不需要单独训练奖励模型。

通过:

优质回答
+
较差回答

直接优化模型。


3.2.4 RLVR

Reinforcement Learning with Verifiable Rewards。

可验证奖励强化学习。

奖励来自:

  • 数学答案是否正确
  • 代码是否通过测试

而不是人工评价。

常用于:

  • 数学推理
  • 编程能力提升

4. 模型微调与优化

4.1 Fine-tuning(微调)

在已有模型基础上继续训练。

主要方式:

  • Full Fine-tuning
  • LoRA
  • QLoRA

4.2 LoRA

Low-Rank Adaptation。

一种参数高效微调方法。

核心:

不修改原模型参数。

增加一个小型适配层。

优势:

  • 显存需求低
  • 训练速度快
  • 适合个人开发

4.3 QLoRA

Quantized LoRA。

结合:

  • 模型量化
  • LoRA微调

典型流程:

FP16模型



4bit量化



LoRA训练

适合消费级显卡。


4.4 Quantization(量化)

量化用于降低模型大小。

常见:

  • FP32
  • FP16
  • INT8
  • INT4

例如:

7B模型:

FP16:

约14GB显存

INT4:

约4GB显存

代价:

一定程度降低精度。


5. 大模型应用工程

5.1 Token

Token 是模型处理文本的基本单位。

模型训练规模通常使用:

参数量 + Token数量

衡量。


5.2 Embedding

Embedding 将文本转换为向量。

例如:

人工智能



[0.23,0.52,...]

用于:

  • 搜索
  • 推荐
  • RAG

5.3 RAG

Retrieval Augmented Generation。

检索增强生成。

解决:

模型不知道外部知识。

流程:

  1. 文档向量化
  2. 存入向量数据库
  3. 用户提问
  4. 检索相关内容
  5. 输入模型生成答案

应用:

  • 企业知识库
  • 私人助手
  • 角色AI

5.4 Prompt Engineering

提示词工程。

通过设计 Prompt 控制模型行为。

特点:

  • 不修改模型参数
  • 成本低
  • 快速验证

5.5 Memory

AI记忆系统。

分为:

Short-term Memory

短期记忆:

当前上下文。

Long-term Memory

长期记忆:

数据库保存用户信息。

通常结合:

  • 数据库
  • RAG

5.6 Agent

智能体。

让模型具备:

  • 规划
  • 调用工具
  • 执行动作

基本流程:

目标



规划



调用工具



观察结果



继续行动

例如:

AI程序员:

  • 阅读需求
  • 编写代码
  • 运行测试
  • 修改代码

6. AI系统工程

6.1 Harness

Harness 指围绕模型构建的系统框架。

包含:

  • Prompt管理
  • Memory
  • 工具调用
  • 状态管理
  • 安全控制

例如:

角色AI:

LLM
+
Persona
+
Memory
+
Harness

6.2 Persona Knowledge

人格知识。

用于角色AI。

包含:

  • 身份背景
  • 性格特点
  • 语言风格
  • 行为规则
  • 人际关系

通常结合:

Persona资料



RAG



Prompt



LLM

总结

现代 LLM 技术体系:

基础模型

Transformer
Attention
MoE

训练

Pre-training
Post-training

    SFT
    RLHF
    DPO
    RLVR

优化

LoRA
QLoRA
Quantization

应用

Embedding
RAG
Prompt
Memory
Agent

系统

Harness
Persona
Tool Calling

理解这套体系后,可以阅读大部分现代大模型论文、项目架构和 AI 产品技术方案。

Back To Note