元认知调控

ReARTeR: Retrieval-Augmented Reasoning with Trustworthy Process Rewarding

ReARTeR 从过程层面提高检索增强推理的可靠性。它结合标量过程奖励、与评分对齐的自然语言解释、考虑偏差的前瞻搜索和逐步后训练, 同时改进中间推理和最终答案。

SIGIR 2025 第一作者 Zhongxiang Sun, Qipeng Wang, Weijie Yu, Xiaoxue Zang, Kai Zheng, Jun Xu, Xiao Zhang, Song Yang, Han Li
ReARTeR

面向可信多步检索增强推理的过程奖励框架。

如何在测试时搜索和后训练过程中,为检索增强推理提供可信的全过程监督?

从研究问题到机制与证据

下面按论文的图表顺序展开。每一节都说明这张图回答了什么问题,又支持了哪一步结论。

1

问题

最终答案监督为什么不够

案例围绕 X.com 问题,串联生成步骤、检索结果、前瞻搜索、PRM 评分和 PEM 修正。

ReARTeR 最终答案监督为什么不够图示

左侧给出一条具体过程轨迹。生成器先询问 Elon Musk 在 1999 年创办的公司并自适应检索;检索器返回证据,说明 X.com 是由 Ed Ho、Harris Fricker、Elon Musk 等人创办的网上银行。下一步询问 X.com 现在的名称,检索结果说明它与 Confinity 合并后 改名为 PayPal。

右侧解释为什么这条轨迹需要过程监督。候选步骤组成搜索树,经过前瞻搜索、rollout 和回传;PRM 给出 0.3、0.4、0.2 等过程分数, PEM 则根据问题分解、检索和答案生成中的错误说明来改写步骤。底部图例把过程分成子问题、检索和推理三类行为。

读图要点
  • 左侧轨迹表明,检索增强推理是一连串生成器与检索器决策。
  • 右侧树表示中间步骤可能形成的候选搜索空间。
  • PRM 分数用于选择路径,PEM 解释说明当前步骤需要修正哪一种过程错误。
2

方法

测试时的过程奖励

图中依次给出 PRM 数据收集、早期步骤偏差修正,以及 PEM 与 PRM 对齐。

ReARTeR 测试时的过程奖励图示

(a) 说明 PRM 训练数据的收集过程。多次 rollout e1、e2、e3 生成候选答案 a1、a2、a3,蒙特卡洛正确率 MC 决定系统是否要调用 更强生成器、使用 OmegaPRM 收集数据,或调整样本以维持分布平衡。

(b) 给出偏差修正的动机:浅层节点的 PRM 偏差可能高于深层节点,偏差修正分数用于减弱这种早期偏好。(c) 对齐 PRM 与 PEM: PRM 为步骤给出 r1、r2,PEM 生成解释 c1,并依据 r2 是否大于 r1 构造正负样本。

读图要点
  • (a) 根据 rollout 正确性收集偏差更小、分布更平衡的 PRM 数据。
  • (b) 说明前瞻搜索为何要修正对浅层节点的偏好。
  • (c) 把 PRM 数值奖励与 PEM 解释联系起来,使过程分数更容易用于具体修正。
3

方法

用步骤级反馈进行后训练

后训练图包括强生成器提供的 warm-up 数据,以及在选中搜索树路径上进行的步骤级离线强化学习。

ReARTeR 用步骤级反馈进行后训练图示

左侧由强生成器采样推理数据,较弱生成器先接受 SFT warm-up。中间随后运行交互式推理:从搜索树选择节点 0,通过二分搜索扩展 候选节点,再用 PRM 和 PEM 修正所选路径。

底部更新流程把带有 +1、-1 标签的路径片段整理为步骤级离线强化学习数据。右侧得到推理微调后的生成器。过程奖励因此既能在 推理时排序路径,也能直接改善生成器。

读图要点
  • 强生成器提供 warm-up 数据,较弱生成器先经 SFT 再进入强化学习。
  • 被选择的树节点会转成带标签的步骤级训练序列。
  • PRM 和 PEM 位于训练闭环内部,不只是训练结束后的外部评价器。
4

结果

不同检索增强推理数据集上的后训练扩展

四条迭代曲线分别给出 2WikiMultiHopQA、Bamboogle、HotpotQA 和 Musique 上的准确率变化。

ReARTeR 不同检索增强推理数据集上的后训练扩展 2WikiMultiHopQA子图

2WikiMultiHopQA

ReARTeR 不同检索增强推理数据集上的后训练扩展 Bamboogle子图

Bamboogle

ReARTeR 不同检索增强推理数据集上的后训练扩展 HotpotQA子图

HotpotQA

ReARTeR 不同检索增强推理数据集上的后训练扩展 Musique子图

Musique

每幅图跟踪强化微调迭代中的表现变化。与只报告一项最终结果相比,曲线可以直接观察训练收益如何形成。

分数据集展示还能看出过程奖励训练在哪些任务上较稳定,哪些任务的收益更依赖具体设置。这组结果把图 3 中的步骤级离线 RL 闭环对应到多跳推理基准上的实际行为。

读图要点
  • 每幅图是一种数据集上的后训练迭代轨迹。
  • 这里需要同时比较曲线形状和最终高度,因为图的主题是训练过程中的扩展行为。
  • 这组实验是图 3 后训练流程的实证结果。
5

结果

PEM 与 PRM 对齐的效果

两个柱图检验过程解释与奖励分数对齐后,是否能改善推理路径修正。

ReARTeR PEM 与 PRM 对齐的效果 PEM 引导改写后的提升率子图

PEM 引导改写后的提升率

ReARTeR PEM 与 PRM 对齐的效果 PEM 与 PRM 对齐后的准确率子图

PEM 与 PRM 对齐后的准确率

左图询问解释能否修复薄弱的中间步骤,右图继续检查这种解释引导的修正是否改善最终检索增强推理结果。两幅图单独检验了 PEM/PRM 对齐的作用。

ReARTeR 不只给出一个过程分数,还把解释放进纠错闭环。因而,这里的实验证据直接关系到解释是否真的带来可测量改善。

读图要点
  • 左图把 PEM 读作低质量步骤的修正机制。
  • 右图把解释对齐重新连接到最终任务表现。
  • 两图说明,数值过程奖励配合与其一致的自然语言解释后,更容易转化为有效修正。

主要实验结果

ReARTeR 分别在专有生成器的测试时扩展,以及开源生成器的测试时加后训练扩展下评估。表中报告 ACC-L,即由 GPT-4o 判断的答案 准确率,并比较 Standard RAG、测试时最强基线 CR-Planner 与 ReARTeR。

多步检索增强推理(ACC-L)

生成器方法2WikiBamboogleHotpotQAMusiqueStrategyQA
GPT-4o-miniStandard RAG0.2920.3280.4500.1880.674
GPT-4o-miniCR-Planner0.4780.5240.4160.2620.744
GPT-4o-miniReARTeR0.5340.5440.5060.3020.772
LLaMA3.1-8BStandard RAG0.2120.2160.3980.0980.674
LLaMA3.1-8BCR-Planner0.3500.3360.3500.0980.654
LLaMA3.1-8BReARTeR0.3640.4840.4340.2520.724

数值范围为 0–1;2Wiki 是 2WikiMultiHopQA 的简称。

结果说明了什么

  • 在十组生成器与数据集的 ACC-L 比较中,ReARTeR 全部超过 CR-Planner。
  • 相对 Standard RAG,GPT-4o-mini 的平均 ACC-L 提高 14.5 个百分点,LLaMA3.1-8B 提高 13.2 个百分点。
  • 两种生成器上的结果共同反映了过程评分、解释引导修正和后训练的作用。

这项工作得到了什么

1

平衡标注改善了过程奖励数据

常规蒙特卡洛标注容易产生偏斜标签,在困难问题上给出的监督也较弱。ReARTeR 平衡正负过程样本,并在普通 rollout 失效时使用 更强生成器。

2

前瞻评分与对齐解释改善步骤修正

PRM 很难只凭局部信息准确判断搜索树中的浅层节点。基于 TD 的前瞻评分利用后续路径信息,降低这种早期步骤偏差。

3

过程奖励同时支持测试时与后训练扩展

测试时,过程奖励引导候选路径搜索和步骤改写;后训练时,同一套奖励机制引导 MCTS 收集步骤级偏好数据。

4

PEM 与 PRM 对齐会影响下游结果

把 PEM 解释与 PRM 分数对齐后,解释引导的改写更容易提高过程奖励,最终任务准确率也随之上升。

在整体研究计划中的位置

ReARTeR 为元认知调控提供过程奖励基础,把检索增强推理从最终答案任务改造成可以逐步监督的执行过程。

可靠智能体需要评价中间行为的奖励信号。ReARTeR 在检索增强推理中提供了这一层,使后续监控、反思和纠错能够落到具体步骤。

资源与引用

@inproceedings{sun2025rearter,
  title={ReARTeR: Retrieval-Augmented Reasoning with Trustworthy Process Rewarding},
  author={Sun, Zhongxiang and Wang, Qipeng and Yu, Weijie and Zang, Xiaoxue and Zheng, Kai and Xu, Jun and Zhang, Xiao and Song, Yang and Li, Han},
  booktitle={Proceedings of the 48th International ACM SIGIR Conference on Research and Development in Information Retrieval},
  pages={1251--1261},
  year={2025}
}