智能体模块机理

Mechanistic Detection and Mitigation of Hallucination in Large Reasoning Models

RHD 将幻觉分析从最终答案推进到完整推理轨迹。它刻画多步推理中的早期波动、浅层模式匹配、错误回溯和伪验证, 再用过程级奖励约束缓解这些失效。

ICLR 2026 第一作者 Zhongxiang Sun, Qipeng Wang, Haoyu Wang, Xiao Zhang, Jun Xu
RHD / GRPO-R

从时间神经动力学分析大推理模型中的推理幻觉。

大推理模型给出错误答案时,幻觉究竟在推理轨迹的哪个阶段形成?

从研究问题到机制与证据

下面按论文的图表顺序展开。每一节都说明这张图回答了什么问题,又支持了哪一步结论。

1

方法

如何测量推理轨迹

方法图说明隐藏状态、LogitLens 词表分布、Reasoning Score、CV Score 和 Attention Score 如何沿推理步骤计算。

RHD / GRPO-R 如何测量推理轨迹图示

左侧从 Transformer 解码层开始:多头自注意力和 FFN 更新隐藏状态,LogitLens 再把中间状态映射到词表分布。 中间的网格沿 c1、c2、c3 直到 cK 跟踪各个推理步骤的分布。

顶部彩色三角形表示各步骤的推理状态,用于计算随步骤变化的 R_score。右侧把 CV Score 定义为标准差与均值之比; Attention Score 统计高注意力的历史步骤中,Reasoning Score 落入浅层或过度思考区间的比例。后文所说的“波动”“稳定” 和“误导性注意”都来自这套测量流程。

读图要点
  • 沿隐藏状态 h 到 LogitLens 的路径,可以看到每一步词表分布的来源。
  • R_score 是整条轨迹中逐步变化的推理强度信号。
  • CV Score 描述早期波动;Attention Score 描述后期是否关注了浅层或过度思考步骤。
2

问题

答案出错以前,轨迹已经偏离

案例图在同一道通胀应用题上,对比了波动明显的幻觉轨迹和较稳定的忠实轨迹。

RHD / GRPO-R 答案出错以前,轨迹已经偏离图示

题目给定去年的价格便宜 10%,要求计算 Liam 现在应支付的金额。左图是约 100 个步骤的幻觉轨迹,R_score 起伏明显; 右图的忠实轨迹更短,R_score 也更稳定。

下方文本框把曲线和具体推理事件连在一起。即使在幻觉轨迹中,步骤 2 到 3 仍是正确验证;步骤 44 到 45 被标为错误验证和 过度思考;步骤 73 则发生错误回溯或误导性注意,最后得到 261.9,而标准答案是 291。错误因此可以定位到具体时间点。

读图要点
  • 红色标注把分数波动与具体故障事件对应起来。
  • 可将幻觉轨迹的步骤 44–45、步骤 73,与忠实轨迹的步骤 23–24 验证过程比较。
  • 261.9 与标准答案 291 的差异是轨迹前期失稳后的终点结果。
3

结果

验证误导性推理模式

三个柱图分别验证 Reasoning Score、CV Score 和 Attention Score。

RHD / GRPO-R 验证误导性推理模式 (a) GSM-NoOp 上的 Reasoning Score 验证子图

(a) GSM-NoOp 上的 Reasoning Score 验证

RHD / GRPO-R 验证误导性推理模式 (b) ReTruthQA 上的模式 #1:早期波动子图

(b) ReTruthQA 上的模式 #1:早期波动

RHD / GRPO-R 验证误导性推理模式 (c) ReTruthQA 上的模式 #2:误导性注意子图

(c) ReTruthQA 上的模式 #2:误导性注意

(a) 比较受误导步骤和未受误导步骤的平均 Reasoning Score。未受误导一组更高,符合“有效推理步骤应带有更强推理信号”的解释。

(b) 与 (c) 分别比较忠实和幻觉样本的 CV Score、Attention Score。图中幻觉样本两项分数都更高,与案例图一致: 幻觉轨迹波动更大,也更容易把注意力集中在有问题的步骤上。

读图要点
  • (a) 用受误导与未受误导的推理状态检验 R_score。
  • (b) 把较高的轨迹波动与幻觉联系起来。
  • (c) 检验幻觉轨迹是否更关注有问题的历史步骤。
4

结果

从轨迹动态走向可靠性分析

饼图、柱图和散点图共同分析一致性上升、Reasoning Score 与困惑度之间的关系。

RHD / GRPO-R 从轨迹动态走向可靠性分析 (a) 一致性分析子图

(a) 一致性分析

RHD / GRPO-R 从轨迹动态走向可靠性分析 (b) Rising-2 准确率比较子图

(b) Rising-2 准确率比较

RHD / GRPO-R 从轨迹动态走向可靠性分析 (c) Reasoning Score 与困惑度子图

(c) Reasoning Score 与困惑度

RHD / GRPO-R 从轨迹动态走向可靠性分析 (d) Rising-2 与稳定状态的困惑度子图

(d) Rising-2 与稳定状态的困惑度

(a) 和 (b) 比较一致性上升与稳定一致性。饼图显示,前者包含的“不一致”比例明显更高;相邻柱图则比较连续步骤之间的一致率。

(c) 将困惑度与 Reasoning Score 放在同一散点图中,图中呈下降趋势:分数越高,困惑度通常越低。(d) 再比较 Rising-2 和稳定条件的平均困惑度。这些结果把轨迹分数与可测量的不确定性联系起来,而不是停留在案例描述。

读图要点
  • (a)–(b) 把一致性读作相邻步骤的属性,不是最终答案的属性。
  • (c) 中可直接观察 R_score 与困惑度的负向趋势。
  • (d) 检查轨迹模式是否伴随可测量的不确定性差异。

主要实验结果

RHD 同时作为推理幻觉检测器和缓解阶段的过程信号进行测试。第一张表报告 ReTruthQA 各领域上的 AUC 与 MC3; 第二张表给出 GRPO-R 对下游推理准确率的影响。

ReTruthQA 推理幻觉检测

骨干模型MATH AUCMATH MC3Science AUCScience MC3MultiHop AUCMultiHop MC3
R1-7B + RHD0.79780.56990.71940.60090.73610.7103
R1-14B + RHD0.72920.46440.76860.56710.72550.5154

AUC 衡量二分类检测,MC3 衡量多轨迹排序;取值范围均为 0–1。

使用 GRPO-R 缓解推理幻觉

骨干模型方法MATH500AIMEGPQA-DGPQA-MGPQA-E
DeepSeek-R1-1.5BGRPO0.7700.3330.3590.3350.359
DeepSeek-R1-1.5BGRPO-R0.7880.3670.4140.3710.357
Qwen2.5-1.5BGRPO0.4800.0330.2470.2140.266
Qwen2.5-1.5BGRPO-R0.4900.1330.2470.2430.275

表中为 MATH500、AIME 2024 和 GPQA 上的准确率,取值范围为 0–1。

结果说明了什么

  • 在 R1-7B 和 R1-14B 上,RHD 的 AUC 都是主表三个领域中报告的最高结果。
  • GRPO-R 在十组骨干模型与基准组合中提升八组、持平一组,仅在一组 GPQA-E 比较中略低。
  • 检测不稳定轨迹所用的推理深度信号,也能用于训练更可靠的策略,诊断与控制由此共用同一过程信号。

这项工作得到了什么

1

Reasoning Score 能区分浅层与深层推理步骤

在 GSM-NoOp 上,被语义无关短语误导的步骤,其 Reasoning Score 低于未受误导的步骤。该分数可以作为浅层模式匹配的内部信号。

2

两种轨迹模式可以定位推理幻觉

幻觉轨迹在早期表现出更大的 Reasoning Score 波动,后期也更容易把注意力放回先前的浅层或过度思考步骤。 CV Score 与 Attention Score 分别把这两种模式量化。

3

过度思考具有可测量的不确定性特征

机制分析比较 Reasoning Score 上升、步骤一致性和困惑度。分数持续上升有时对应的是过度思考和伪验证,并非可靠纠错。

4

GRPO-R 把诊断信号变成步骤级奖励

GRPO-R 通过基于势函数的塑形,把机制分析得到的深度推理信号加入强化学习。奖励直接作用于中间步骤,同时保留结果目标。

在整体研究计划中的位置

RHD 补上了“AI 智能体认知神经科学”中的时间推理层,使只看答案的评估无法观察到的推理路径变得可测量。

任何需要多步规划、搜索、证明或调试的智能体都会遇到这个问题。可靠性既取决于答案是否正确,也取决于生成答案的路径是否稳定、 是否随证据调整,并能否在出错后自行修正。

资源与引用

@inproceedings{sun2026mechanistic,
  title={Mechanistic Detection and Mitigation of Hallucination in Large Reasoning Models},
  author={Sun, Zhongxiang and Wang, Qipeng and Wang, Haoyu and Zhang, Xiao and Xu, Jun},
  booktitle={The Fourteenth International Conference on Learning Representations},
  year={2026}
}