后训练 RLHF RLVR 指令微调 Agentic RL

大模型后训练全景:从指令微调到 RLVR 与智能体强化学习

系统梳理大模型(LLM / VLM / 3D 生成模型)后训练的完整技术栈:指令微调、偏好对齐、RLVR、工具调用与智能体强化学习,并给出一套可复现、可对照的后训练能力证明方法论。

2026-06-11 13 分钟阅读
文章目录23

大模型后训练全景:从指令微调到 RLVR 与智能体强化学习

——流水线、能力专项,以及一套可信的能力证明方法论

导言: 预训练(Pre-training)决定了模型的知识上限,而后训练(Post-training)决定了模型最终"好不好用"。从 InstructGPT 确立 SFT + RLHF 范式 [1],到 DPO 简化偏好对齐 [2],再到 DeepSeek-R1 以可验证奖励强化学习(RLVR)点燃推理模型浪潮 [3],后训练已经从"预训练的收尾工序"演变为一个独立、完整、且占用算力比例持续上升的技术栈 [4]。本文系统梳理后训练的标准流水线与能力专项训练,辨析视觉模型(ViT/VLM)与 3D Gaussian Splatting 语境下"后训练"的不同含义,并给出一套面向工程团队的、可复现的后训练能力证明方法论。


一、LLM 后训练的标准流水线

现代后训练的共识结构是"监督微调 → 偏好对齐 → 可验证奖励强化学习"三大段 [4][5]。需要强调的是:前沿模型普遍采用多轮迭代混合的流水线(例如 Base → RL → SFT → RL → SFT),而非线性走一遍 [5]。

阶段解决什么问题代表方法
继续预训练 / Mid-training领域知识注入、长上下文扩展领域 CPT、YaRN [6]
监督微调(SFT)指令遵循的基本盘、输出格式全参微调、LoRA [7]
偏好对齐(Preference Tuning)风格、有用性、安全性等难以规则化的人类偏好RLHF/PPO [1]、DPO [2]、RLAIF [8]
可验证奖励强化学习(RLVR)数学、代码等可客观判定的推理能力GRPO [9]、规则奖励 [3][10]
蒸馏与收尾能力压缩到小模型、部署优化数据/Logits 蒸馏 [3]、模型合并

1.1 继续预训练 / Mid-training(边界阶段)

严格说不属于后训练,但实践中常由同一团队负责:

  • 领域继续预训练(Continued Pre-Training, CPT):医疗、法律、金融等垂直领域语料的二次预训练;
  • 长上下文扩展:通过 RoPE 插值类方法(如 YaRN [6])配合长文档语料,把上下文窗口从 8K 扩展到 128K 以上;
  • 词表扩展:多语言或领域术语场景下扩充 tokenizer。

1.2 监督微调 / 指令微调(SFT)

SFT 教会模型"听懂指令、按格式回答"。这一阶段的核心竞争力不在训练代码,而在数据工程

  • 数据合成:Self-Instruct [11]、Evol-Instruct [12]、Magpie [13] 等方法用强模型批量生成指令数据;
  • 质量优先于数量:LIMA 证明了千条级高质量数据即可完成基本对齐,"表面对齐假说"由此提出 [14]——尽管在推理模型时代该假说已被部分修正 [4];
  • 数据治理:去重、质量过滤、任务配比,以及最容易被忽视的评测集去污染(Decontamination)
  • 工程选型:全参微调 vs LoRA/QLoRA [7] 的成本-效果权衡、chat template 设计、多轮对话与 system prompt 遵循。

1.3 偏好对齐(Preference Tuning)

解决"风格、有用性、无害性"这类难以写成规则的人类偏好:

  • 经典 RLHF:先用人类偏好对训练奖励模型(Reward Model, RM),再以 PPO 优化策略模型 [1];
  • 免 RM 的直接偏好优化:DPO 把 RLHF 目标改写为分类损失,省掉 RM 与在线采样 [2];衍生出 KTO [15]、SimPO [16] 等变体,各有数据形态与长度偏置上的取舍;
  • RLAIF / Constitutional AI:用 LLM 充当偏好标注者,以一组"宪法"原则替代大规模人标 [8]。

1.4 可验证奖励强化学习(RLVR):当前最热的主线

RLVR(Reinforcement Learning with Verifiable Rewards)一词由 Tülu 3 工作提出 [10],DeepSeek-R1 将其推向大规模实践 [3]。核心思想是用客观验证器替代人类偏好作为奖励

  • 奖励来源:数学答案解析器、代码执行与单元测试、格式校验器——而非人类排序;
  • 算法标配:GRPO(Group Relative Policy Optimization)去掉了 PPO 的价值网络,以组内相对奖励估计优势函数,显著降低显存与训练不稳定性 [9];
  • 产出形态:o1 / R1 式长思维链(Long Chain-of-Thought)推理模型,"先想后答";
  • 配套技术:冷启动 SFT、过程奖励模型(PRM)与结果奖励模型(ORM)的取舍 [17]、熵控制、长度控制、拒绝采样数据回流。

二、能力专项后训练

以下专项通常穿插在 SFT 与 RL 各阶段中进行,是工业级后训练与"跑一遍开源脚本"的分水岭。

2.1 工具调用(Tool Calling / Function Calling)

让模型可靠地产出结构化函数调用,是 Agent 应用的地基:

  • 训练目标:JSON Schema 遵循、并行调用、多轮工具链、调用失败后的自我修复;
  • 数据来源:真实/模拟 API 轨迹合成(Toolformer [18]、ToolLLM [19] 是早期代表);
  • 评测标尺Berkeley Function Calling Leaderboard(BFCL)覆盖单轮、多轮、并行与 Agentic 场景 [20],是该方向最常被引用的公开榜单。

2.2 智能体强化学习(Agentic RL)

后训练当前的最前沿:模型不再只优化单条回复,而是在可交互环境中优化多步决策[21]:

  • 轨迹监督:先用 ReAct 式"推理-行动"轨迹做 SFT 冷启动 [22];
  • 环境内 RL:奖励来自工具执行结果与任务完成度(修复 GitHub Issue、网页操作、终端任务),面对多步稀疏奖励与信用分配难题;
  • 代表评测:SWE-bench Verified(真实仓库修 bug)[23]、τ-bench(多轮工具-用户交互)[24]。

2.3 其他高频专项

  • 代码与数学:执行反馈与判分器天然适配 RLVR;
  • RAG 适配:引用忠实度、抗噪检索、"不知道就说不知道"的校准;
  • 安全对齐:拒答校准、红队攻防、越狱防御,以及与有用性之间的"对齐税"权衡 [8];
  • 蒸馏:强教师造数据(off-policy)或 on-policy 蒸馏,把推理能力压进小模型——R1-Distill 系列验证了纯 SFT 蒸馏即可迁移大部分推理能力 [3];
  • 收尾:模型合并(Model Soup / 任务向量)、量化感知训练。

三、视觉与多模态:ViT 与 VLM 的后训练

3.1 纯视觉骨干(ViT)

视觉模型语境下的"后训练"通常指预训练骨干的下游适配

  • 自监督预训练(如 MAE [25])产出通用表征后,按算力与数据量选择 Linear Probe、全参微调或 Adapter / Visual Prompt Tuning;
  • 下游任务接检测、分割等任务头后端到端微调。

3.2 视觉语言模型(VLM):与 LLM 流水线合流

VLM 的后训练已收敛为与 LLM 高度同构的三段式(以 LLaVA 为奠基范式 [26]):

  1. 模态对齐:冻结视觉编码器与 LLM,只训练投影层(Projector),把视觉特征"翻译"进语言空间;
  2. 视觉指令微调:放开 LLM,用多模态指令数据做 SFT [26];
  3. 多模态偏好对齐与 RLVR:RLHF-V 等方法用细粒度人类偏好抑制幻觉 [27];R1 之后,GRPO 同样被迁移到视觉推理任务(几何题、图表问答)上。

3.3 3D Gaussian Splatting:一个常见的概念错位

需要特别澄清:经典 3DGS 不存在"预训练-后训练"范式。原始 3DGS 是逐场景(per-scene)的可微优化——每个场景从 SfM 点云出发独立拟合高斯基元 [28],没有跨场景共享的权重,自然谈不上后训练。

真正具有后训练语义的是近年的前馈式(Feed-forward)3D 大模型

  • 大型重建/生成模型:LGM [29]、GS-LRM [30]、TRELLIS [31] 等以网络权重直接预测 3D 表示,可以做下游微调、LoRA 适配与领域定制;
  • SDS 蒸馏:以 2D 扩散模型为先验、通过 Score Distillation Sampling 优化 3D 表示(DreamFusion 范式 [32])——这是"用预训练模型的知识改造 3D 资产",而非对 3D 模型本身的后训练;
  • 部署后处理:高斯剪枝、压缩与量化,属于工程优化而非能力训练。

面试或技术评审中混淆这两种语义,是 3D 方向最常见的减分项。


四、如何证明后训练能力:构建可信的证据链

后训练能力难以靠"做过"二字自证——数据、算力、基线选择都会显著影响结果。可信的证明遵循一个核心原则:同一基座模型上的可复现对照实验,是唯一的硬通货

4.1 黄金标准:同基座对照实验

最有说服力的单一证据:

  1. 选公开基座(如 Qwen 系列 Base、Llama 系列 Base);
  2. 自行完成 SFT → 偏好对齐 → RLVR 完整流水线;
  3. 在统一评测框架(如lm-evaluation-harness[33] 或 OpenCompass)下,逐项对比官方 Instruct 版本
  4. 公开数据配方与训练脚本。

进阶叙事:"只用官方 1/10 的数据或算力,在目标维度追平"——这直接证明了数据效率与方法功底。Tülu 3 正是这一路线的标杆:全套数据、代码、评测开源,结果可被任何人复验 [10]。

4.2 公开基准:按能力维度选对标尺

注意基准的"保质期"——GSM8K、HumanEval 等对前沿模型已饱和,不应作为主证据:

能力维度当前有效的公开基准
工具调用BFCL(单轮/多轮/并行/Agentic 全覆盖)[20]
智能体SWE-bench Verified [23]、τ-bench [24]、GAIA
通用对话Arena-Hard [34]、AlpacaEval 2.0(长度可控胜率)[35]
推理AIME、GPQA Diamond
多模态MMMU、MathVista

4.3 开源三件套

  • 模型:HuggingFace 发布 + 完整模型卡(训练数据、评测、限制声明);
  • 技术报告:数据配方、超参、消融实验与失败案例分析;
  • 可复现脚本:训练 + 评测一键复跑。

4.4 消融实验:证明你懂"为什么"

逐阶段拆解贡献(SFT only → +DPO → +RLVR 各涨多少分)、数据配比消融、奖励设计消融。这是区分"会跑脚本"与"懂后训练"的分水岭。

4.5 工程深度与踩坑叙事

后训练的工程债极重,真实的 debug 经历比榜单分数更稀缺:

  • 训练框架:verl [36]、OpenRLHF、TRL、LLaMA-Factory;分布式后端 FSDP / Megatron / DeepSpeed;RL rollout 引擎 vLLM / SGLang;
  • 经典故障与修复:奖励黑客(Reward Hacking)、DPO 长度偏置 [16]、GRPO 熵坍缩、灾难性遗忘、对齐税——能讲清楚"如何发现、如何定位、如何修复"的人极少。

4.6 评测素养本身就是高级信号

可复现评测的公认实践:评测集去污染报告、基准版本固定(如 BFCL 各版本方法论差异显著)、容器化评测环境、优先使用确定性验证器而非纯 LLM 裁判、报告置信区间。能把评测做严谨,本身就是后训练成熟度的证明。


五、总结

后训练已经形成清晰的技术栈分层:SFT 打底、偏好对齐塑形、RLVR 拔高推理、专项训练(工具调用 / Agentic RL / 安全)补全产品能力、蒸馏与合并收尾。视觉多模态正与这条主线合流,而 3D 表示学习则需要先辨析"逐场景优化"与"前馈大模型"的范式差异。

证明能力的路径同样清晰:与其罗列"做过什么",不如交付一条同基座、可复现、带消融的完整证据链——选一个可量化的垂直能力(例如工具调用,恰好有 BFCL 这样的标尺),从公开基座复现 SFT → DPO → GRPO 全流程,写成带消融的技术报告并开源。一个这样的项目,胜过十页项目经历。


参考文献

  1. Ouyang, L., et al. (2022). Training Language Models to Follow Instructions with Human Feedback.NeurIPS 2022.arXiv:2203.02155
  2. Rafailov, R., et al. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model.NeurIPS 2023.arXiv:2305.18290
  3. DeepSeek-AI. (2025). DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.arXiv:2501.12948
  4. Lambert, N.RLHF: Reinforcement Learning from Human Feedback(在线书籍).rlhfbook.com
  5. Large Language Models Post-Training: Surveying Techniques from Alignment to Reasoning. (2025).arXiv:2503.06072
  6. Peng, B., et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models.arXiv:2309.00071
  7. Hu, E., et al. (2021). LoRA: Low-Rank Adaptation of Large Language Models.ICLR 2022.arXiv:2106.09685
  8. Bai, Y., et al. (2022). Constitutional AI: Harmlessness from AI Feedback.arXiv:2212.08073
  9. Shao, Z., et al. (2024). DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.arXiv:2402.03300
  10. Lambert, N., et al. (2024). Tülu 3: Pushing Frontiers in Open Language Model Post-Training.arXiv:2411.15124
  11. Wang, Y., et al. (2022). Self-Instruct: Aligning Language Models with Self-Generated Instructions.ACL 2023.arXiv:2212.10560
  12. Xu, C., et al. (2023). WizardLM: Empowering Large Language Models to Follow Complex Instructions.arXiv:2304.12244
  13. Xu, Z., et al. (2024). Magpie: Alignment Data Synthesis from Scratch by Prompting Aligned LLMs with Nothing.arXiv:2406.08464
  14. Zhou, C., et al. (2023). LIMA: Less Is More for Alignment.NeurIPS 2023.arXiv:2305.11206
  15. Ethayarajh, K., et al. (2024). KTO: Model Alignment as Prospect Theoretic Optimization.arXiv:2402.01306
  16. Meng, Y., et al. (2024). SimPO: Simple Preference Optimization with a Reference-Free Reward.NeurIPS 2024.arXiv:2405.14734
  17. Lightman, H., et al. (2023). Let's Verify Step by Step.arXiv:2305.20050
  18. Schick, T., et al. (2023). Toolformer: Language Models Can Teach Themselves to Use Tools.NeurIPS 2023.arXiv:2302.04761
  19. Qin, Y., et al. (2023). ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs.ICLR 2024.arXiv:2307.16789
  20. Berkeley Function Calling Leaderboard (BFCL).gorilla.cs.berkeley.edu/leaderboard.html
  21. The Landscape of Agentic Reinforcement Learning for LLMs: A Survey. (2025).arXiv:2509.02547
  22. Yao, S., et al. (2022). ReAct: Synergizing Reasoning and Acting in Language Models.ICLR 2023.arXiv:2210.03629
  23. Jimenez, C., et al. (2023). SWE-bench: Can Language Models Resolve Real-World GitHub Issues?ICLR 2024.arXiv:2310.06770
  24. Yao, S., et al. (2024). τ-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains.arXiv:2406.12045
  25. He, K., et al. (2022). Masked Autoencoders Are Scalable Vision Learners.CVPR 2022.arXiv:2111.06377
  26. Liu, H., et al. (2023). Visual Instruction Tuning.NeurIPS 2023.arXiv:2304.08485
  27. Yu, T., et al. (2024). RLHF-V: Towards Trustworthy MLLMs via Behavior Alignment from Fine-grained Correctional Human Feedback.CVPR 2024.arXiv:2312.00849
  28. Kerbl, B., et al. (2023). 3D Gaussian Splatting for Real-Time Radiance Field Rendering.ACM Transactions on Graphics.项目主页
  29. Tang, J., et al. (2024). LGM: Large Multi-View Gaussian Model for High-Resolution 3D Content Creation.ECCV 2024.arXiv:2402.05054
  30. Zhang, K., et al. (2024). GS-LRM: Large Reconstruction Model for 3D Gaussian Splatting.ECCV 2024.arXiv:2404.19702
  31. Xiang, J., et al. (2024). Structured 3D Latents for Scalable and Versatile 3D Generation (TRELLIS).arXiv:2412.01506
  32. Poole, B., et al. (2022). DreamFusion: Text-to-3D using 2D Diffusion.ICLR 2023.arXiv:2209.14988
  33. EleutherAI. lm-evaluation-harness.GitHub 仓库
  34. Li, T., et al. (2024). From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline.arXiv:2406.11939
  35. Dubois, Y., et al. (2024). Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators.arXiv:2404.04475
  36. Sheng, G., et al. (2024). HybridFlow: A Flexible and Efficient RLHF Framework (verl).EuroSys 2025.arXiv:2409.19256