Research Hub·← 返回索引research.jingyijun.com

错误分布—纠错学习

大模型、多模态与具身智能中,是否存在“构建完全错误的分布,先让模型拟合/经历错误,再通过全方位纠错学会避免所有错误”的研究思想?尤其是 RL exploration 中主动让模型犯错。

调研日期:2026-07-03 范围:LLM / MLLM / Agent / Embodied RL 结论类型:谱系梳理 + 可行 recipe

一、直接结论

有相邻思想,但几乎没有严肃工作会直接“训练模型拟合一个完全错误的分布”。更常见、也更有效的版本是:故意生成或采样错误轨迹、错误答案、幻觉回答、失败动作,把它们作为负样本、批判对象、偏好对中的 rejected response、反思记忆、或 RL 探索经验,然后用 verifier / reward / critique / correction 把策略推离这些错误。

也就是说,你描述的思想在文献里不是一个统一名字,而是一组方法的交集:

暴露错误分布
wrong traces
定位错误
critique / verifier
给出纠正
revision / feedback
更新策略
SFT / DPO / RL
避免复犯
reflection / reward

最接近的关键词包括:learning from mistakeslearning from failurenegative examplesself-correctioncritique-and-revisionunlikelihood trainingpreference optimizationverbal reinforcement learningtrial-and-error RLsafe exploration

二、研究简报

维度设定
目标寻找大模型、多模态、具身智能中“错误分布 + 纠错学习 + RL 探索犯错”的工作谱系,并判断是否存在与你描述完全一致的范式。
读者假设读者熟悉 LLM SFT / RLHF / DPO / RLVR / Agent 基本概念。
范围2020–2026 年间的 LLM reasoning、agent、MLLM hallucination、embodied / robotics RL 与安全探索。
排除不展开传统 supervised adversarial training、普通数据增强、纯 benchmark 排名。
证据优先级原始论文、arXiv、项目页、作者官方博客;综述和新闻只用于发现线索。
交付中文 HTML 报告,含谱系、代表论文、机制分析、与你设想的差异、可落地实验 recipe。

三、方法谱系:与你想法的距离

谱系是否“先学错”核心机制与你设想的关系
错误答案 → 纠错轨迹 SFT部分是收集错误解、错误原因、正确修订,让模型学习“从错到对”的映射。最接近“全方位纠错”,但不是让最终策略拟合错误分布,而是拟合纠错过程。
负样本 / rejected response 偏好优化不是DPO/RLHF 把错误回答作为低偏好样本,优化策略远离它。错误分布作为反例,不作为目标分布。
Self-correction RL部分是训练模型先产出初答,再在奖励驱动下修正自己的答案。接近“让模型知道自己会错,并学会改”。
Agent trial-and-error / Reflexion环境中执行、失败、反思、把失败经验写入记忆或训练数据。最接近“RL exploration 中让它犯错”。
Embodied / robotics safe exploration是,但受约束探索失败、碰撞、不可达、任务失败,用代价函数/安全约束/离线数据学习避错。真实物理环境不能无限犯错,通常用模拟器、shield、constraint。
MLLM hallucination correction部分是构造幻觉回答和细粒度纠正反馈,用 RLHF/DPO 抑制视觉幻觉。多模态领域的“错误分布”主要是 hallucination 分布。

四、代表工作

4.1 LLM:Learning from Mistakes / Self-Correction

工作年份做了什么关键启发
LeMa: Learning From Mistakes Makes LLM Better Reasoner 2023 把错误推理路径转换成“错误解释 + 正确修正”的学习数据,用于提升数学推理。 非常接近“让模型看见错误并学习纠错”,但目标是学习 mistake-correction data,不是拟合纯错误分布。
SCoRe: Training Language Models to Self-Correct via Reinforcement Learning 2024 用多轮输出与奖励训练模型自我修正,避免只在分布外 correction traces 上学表演式修改。 把“犯错后能改”从 prompting 能力推进到策略训练目标。
Reflexion: Language Agents with Verbal Reinforcement Learning 2023 Agent 执行任务失败后生成 verbal reflection,存入 episodic memory,下次决策时避免同类错误。 RL exploration 中“犯错→反思→避免复犯”的经典 LLM agent 版本。
Learning From Failure: Integrating Negative Examples when Fine-tuning LLMs as Agents 2024 研究在 fine-tuning agent 时如何使用失败轨迹/负例,而不是只用成功专家轨迹。 直接命中“negative examples for agents”;重点是负例如何不伤害策略学习。
Do Not Step Into the Same River Twice: Learning to Reason from Trial and Error 2025 围绕 trial-and-error 经验让模型从失败尝试中学 reasoning。 标题和主题都很贴近“不要重复犯同样错误”。

4.2 RLVR / Reasoning RL:探索犯错,但奖励只强化对的

工作年份做了什么与错误分布的关系
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning 2025 用可验证奖励强化推理能力,展示纯 RL 阶段可诱发长链推理、自我验证等行为。 探索中会产生大量错误 rollout;但训练目标不是学错,而是通过 reward 选择性强化正确轨迹。
Spurious Rewards: Rethinking Training Signals in RLVR 2025 讨论 RLVR 中 reward signal 可能存在 spurious / shortcut,模型可能学到非预期策略。 提醒:如果“错误分布/纠错奖励”设计差,模型会学会钻奖励空子,不是真避错。
Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model? 2025 分析 RLVR 增益来自哪里,质疑 RL 是否创造新能力还是放大 base model 已有能力。 对“通过犯错学会所有错”提出边界:RL 可能主要重排和放大已有行为。

4.3 多模态:幻觉就是错误分布

工作年份做了什么启发
LLaVA-RLHF: Aligning Large Multimodal Models with Factually Augmented RLHF 2023 把视觉问答中的事实一致性纳入 RLHF,缓解 MLLM hallucination。 多模态版“错误回答/幻觉回答作为负反馈”。
RLHF-V: Towards Trustworthy MLLMs via Behavior Alignment from Fine-grained Correctional Human Feedback 2023 使用细粒度 correctional human feedback 对齐 MLLM 行为。 “全方位纠错”的多模态版本:不是只标好坏,而是标哪里错、怎么改。
HA-DPO: Hallucination-targeted Direct Preference Optimization for LVLMs 2023 针对 hallucination 构造偏好对,用 DPO 抑制视觉语言模型胡编。 错误分布被显式建模成 rejected side。
Silkie: Preference Distillation for Large Visual Language Models 2023 用偏好蒸馏提升 LVLM 对齐,通常涉及 chosen / rejected 视觉语言回答。 可视为用错误候选塑造决策边界。

4.4 负样本训练的老谱系:Unlikelihood / Contrastive / DPO

工作年份机制为什么相关
Unlikelihood Training for Neural Text Generation 2019 对不希望生成的 token / sequence 施加 unlikelihood loss。 最朴素的“让模型不要学错”;直接把错误事件概率压低。
Direct Preference Optimization 2023 用 chosen/rejected response 对直接优化策略,无需显式 reward model。 现代 LLM 中最常见的“错误回答作为反例”训练框架。
Constitutional AI 2022 模型先生成有害/不合规回答,再依据原则 critique 和 revise,之后用偏好训练。 安全对齐领域很接近“先暴露错,再系统纠正”。

五、具身与 RL Exploration:让它犯错是常态,但不能无约束

在 embodied AI / robotics 里,“通过 exploration 犯错”是 RL 的常态:agent 试动作、撞墙、跌倒、拿错物体、路径失败,然后通过 reward、constraint、value function、offline dataset 或 world model 学会避错。但真实机器人不能像语言模型那样无限犯错,所以研究会把“错误分布”放进以下容器:

模拟器

在 Habitat、AI2-THOR、ManiSkill、Isaac、MuJoCo 等环境中廉价产生失败轨迹,再迁移到真实世界。

安全约束

Safe RL / constrained RL 用 cost、shield、barrier function 限制灾难性错误,只允许可承受的试错。

失败记忆

Agent 把失败 episode 总结成 language memory 或 skill library,下次规划避开。

与 LLM agent 最相关的是 ReflexionVoyager、以及后续大量 WebShop / ALFWorld / Minecraft / embodied task 的 trial-and-error agent。它们不一定更新模型权重,有些只是 test-time memory;但思想上正是“让它探索犯错,再把错误转化成可复用经验”。

六、为什么不是“拟合完全错误的分布”?

如果真的用最大似然让模型拟合一个完全错误的分布,通常会得到灾难性结果:模型会提高错误输出概率,随后纠错阶段需要花更多代价把错误擦掉。文献中更稳的做法是:

  1. 错误作为输入条件:给模型看错误解,让它输出 critique / revision。
  2. 错误作为负标签:在 DPO/RLHF/unlikelihood 中降低错误输出概率。
  3. 错误作为探索经验:在 RL rollout 中产生错误,但只强化带来高 reward 的修正行为。
  4. 错误作为 curriculum:从常见错、轻微错、局部错开始,逐步覆盖更复杂失败模式。

关键区别:不是“先把模型训坏,再把它训好”;而是“系统性暴露坏样本,并让优化目标明确知道坏在哪里、好在哪里、如何从坏变好”。

七、如果要做成研究项目:最小可行 Recipe

如果你的目标是提出一个统一范式,可以叫 Error-Distribution Correction LearningMistake-Driven RL。最小版本不需要发明复杂框架,直接复用现有组件:

阶段数据/动作训练信号最小实现
1. 错误生成让 base model / policy 在任务上采样多条失败轨迹。verifier 判错、环境 reward、人工/模型 critique。温度采样 + unit tests / exact match / simulator reward。
2. 错误归因标注是感知错、推理错、工具错、动作错、幻觉错、格式错。错误 taxonomy。LLM judge + 少量人工抽检。
3. 纠错轨迹为每个失败样本生成 critique、修订计划、正确答案或成功轨迹。mistake → correction pairs。SFT 训练 critique/revise。
4. 反偏好优化构造 chosen=修正后,rejected=原错误。DPO / IPO / KTO。先 DPO,别上复杂 RL。
5. 探索 RL让模型继续 rollout,奖励“发现错误并修正后成功”。verifiable reward + correction bonus。数学/代码任务用测试器;具身任务用模拟器。
6. 防 reward hacking检查模型是否只会写反思废话、过度修改、钻 verifier 空子。held-out verifier / adversarial eval。保留原任务成功率 + 修改必要性指标。

Ponytail 版最小实验:选 GSM8K/Math 或代码修 bug。采样错误答案;用 verifier 找错;生成一条 correction;训练 DPO。先证明“错误反例 + 修正”比只用正确答案 SFT 更省样本,再扩展到 RL。

八、概念地图

你的术语文献里更可能搜到的术语推荐入口
完全错误的分布negative examples, failure trajectories, rejected responses, hallucinated responsesLearning From Failure, DPO, HA-DPO
全方位纠错critique, revision, self-correction, correctional feedbackLeMa, SCoRe, RLHF-V, Constitutional AI
RL explore 中让它犯错trial-and-error learning, verbal reinforcement learning, exploration, safe RLReflexion, Voyager, RLVR papers
避免所有错误avoid repeated failures, hallucination mitigation, robustness, safe explorationSelf-correction evals, hallucination DPO, constrained RL

九、边界与不确定性

  • “所有错误”不可穷尽。可行目标是覆盖高频错误模式、任务分布内错误、或 verifier 可判定错误。
  • 负样本会伤模型。如果没有清晰的 chosen/rejected 或 critique/revision 结构,模型可能学到错误表面形式。
  • 自纠错容易表演化。模型可能学会“改一改语气”而不是真正修正,需要外部 verifier。
  • RL exploration 有安全成本。具身场景必须用模拟器或 safety shield,不能让真实系统自由犯灾难性错误。
  • RLVR 的真实增益仍有争论。2025 年后多篇工作指出 reward、base model 能力、采样预算都可能解释一部分提升。

十、主要参考源

  1. LeMa: Learning From Mistakes Makes LLM Better Reasoner
  2. SCoRe: Training Language Models to Self-Correct via Reinforcement Learning
  3. Reflexion: Language Agents with Verbal Reinforcement Learning
  4. Learning From Failure: Integrating Negative Examples when Fine-tuning LLMs as Agents
  5. Do Not Step Into the Same River Twice: Learning to Reason from Trial and Error
  6. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
  7. Spurious Rewards: Rethinking Training Signals in RLVR
  8. Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?
  9. LLaVA-RLHF: Aligning Large Multimodal Models with Factually Augmented RLHF
  10. RLHF-V: Towards Trustworthy MLLMs via Fine-grained Correctional Human Feedback
  11. HA-DPO: Hallucination-targeted Direct Preference Optimization for LVLMs
  12. Silkie: Preference Distillation for Large Visual Language Models
  13. Unlikelihood Training for Neural Text Generation
  14. Direct Preference Optimization
  15. Constitutional AI: Harmlessness from AI Feedback
  16. Voyager: An Open-Ended Embodied Agent with LLMs

十一、最终判断

如果把你的想法严格表述为“先拟合完全错误分布,再纠错”,目前不是主流,也不推荐。如果改写成“主动构造/采样覆盖充分的错误分布,把错误作为负样本、反思对象、纠错轨迹和 RL 探索经验,让模型学会识别、修正、避免复犯”,那已有大量相关工作,而且在 LLM agent、多模态 hallucination、RLVR reasoning 和具身探索里都成立。

最值得深挖的主线是:LeMa + SCoRe + Learning From Failure + Reflexion + HA-DPO/RLHF-V + DeepSeek-R1/RLVR。这些拼起来就是你要的“犯错驱动学习”理论雏形。