元认知调控

Deep Search with Hierarchical Meta-Cognitive Monitoring Inspired by Cognitive Neuroscience

DS-MCM 将元认知监测引入长程搜索智能体。框架加入快速监测、较慢的反思诊断和经验更新, 使智能体能够发现异常、分析原因、修正执行,并在后续任务中复用经验。

SIGIR 2026 第一作者 Zhongxiang Sun, Qipeng Wang, Weijie Yu, Jingxuan Yang, Haolang Lu, Jun Xu
DS-MCM

校准推理不确定性与证据不确定性,并按需触发经验驱动纠错的深度搜索框架。

深度搜索智能体如何在长程任务中监测自身执行、诊断错误并及时修正行为?

从研究问题到机制与证据

下面按论文的图表顺序展开。每一节都说明这张图回答了什么问题,又支持了哪一步结论。

1

问题

深度搜索为什么需要元认知监测

图中依次比较人类的分层元认知监测、缺少监控并最终出错的普通深度搜索智能体,以及加入 MCM 后的搜索智能体。

DS-MCM 深度搜索为什么需要元认知监测图示

顶部把人类监控映射到执行过程:与 ACC 相关的快速监控器负责低成本异常检测,并选择性触发慢速监控;后者与 PFC 和海马体相关, 通过记忆进行显式反思。执行则从任务开始,经过多个步骤,直到完成。

中间一行是普通深度搜索智能体的故障路径:问题、工具调用、推理、重复执行,最后产生错误。底部加入 MCM。在图示的失踪 16 岁少年 查询中,系统经过工具与推理步骤后识别出“没有理解问题”的故障,触发重新思考,随后得到修正结果。

读图要点
  • 顶部根据 ACC 与 PFC+hippocampus 的标注,区分快速异常检测和慢速反思。
  • 中间的普通搜索循环虽然有工具和推理模块,却没有明确的纠错节点。
  • 底部 MCM 在最终回答前加入问题理解诊断和重新思考。
2

方法

DS-MCM 的执行与监控流程

方法图完整画出 ReAct 式执行循环、快速一致性监控器、慢速经验驱动监控器和记忆更新。

DS-MCM DS-MCM 的执行与监控流程图示

顶部执行流程从用户问题 q 开始。步骤 s_t 交替产生检索动作、文档集 D_t、语义簇 C_t、推理轨迹和 token 分布 p_r, 再计算 Searching Entropy SE_t 与 Reasoning Entropy RE_t,送入快速一致性监控器。

黄色监控框根据 Searching Entropy 校准期望的 Reasoning Entropy,计算 epsilon_t;当 |epsilon_t| 超过阈值 tau 时触发慢速监控。 下方蓝色区域由历史轨迹构造记忆,分别检索成功与失败经验,通过批判模型 C 生成修正建议 delta_t 或错误标记 err_t,最后再去重并更新记忆。

读图要点
  • SE_t 来自检索证据,RE_t 来自推理 token 分布。
  • 快速监控器根据校准后的熵失配判断当前步骤是一致还是偏离。
  • 慢速监控器把成功、失败经验转成修正建议,并把新经验写回记忆。
3

结果

监控机制的稳健性检查

三幅图分别考察准确率随熵阈值 k、检索记忆数量 |R| 和检索文档 top-K 的变化。

DS-MCM 监控机制的稳健性检查 (a) 熵阈值 k子图

(a) 熵阈值 k

DS-MCM 监控机制的稳健性检查 (b) 检索监控记忆数量 |R|子图

(b) 检索监控记忆数量 |R|

DS-MCM 监控机制的稳健性检查 (c) 检索文档 top-K子图

(c) 检索文档 top-K

(a) 改变熵阈值 k,(b) 改变检索记忆条数 |R|,(c) 改变检索文档数量 top-K。三个子图中,蓝色 Tongyi-Deepresearch 曲线都明显高于紫色虚线 Mirothinker-Deepresearch 曲线。

最优设置并不总在最大取值处:蓝色曲线在中等 k 和 |R| 附近达到峰值,(c) 也在中等 top-K 附近最高。 这说明触发阈值和检索预算本身就是监控机制的一部分,需要在灵敏度与噪声之间取平衡。

读图要点
  • (a) 用熵阈值 k 检查快速监控器的触发灵敏度。
  • (b) 检查慢速监控需要检索多少条历史经验。
  • (c) 用 top-K 文档数量检查证据检索预算。

主要实验结果

DS-MCM 使用三个开源骨干模型,在四个深度搜索基准上评估。表中比较原始系统、LLM-as-Critic 基线和 DS-MCM;GPT-5 仅作为 论文中报告的专有系统参照。

深度搜索基准准确率(%)

系统BrowseComp+BrowseComp-ZHX-BenchGAIA平均值
GPT-5(参照)70.034.375.062.860.5
Tongyi-DR51.038.069.070.157.0
Tongyi-DR + Critic55.042.068.069.358.6
Tongyi-DR + DS-MCM62.0*45.0*74.0*71.763.2*
MiroThinker-DR21.031.062.063.844.5
MiroThinker-DR + Critic24.030.064.063.045.2
MiroThinker-DR + DS-MCM26.034.0*68.0*69.3*49.3*
Qwen3-30B-MoE5.021.042.040.927.2
Qwen3-30B-MoE + Critic22.027.047.043.334.8
Qwen3-30B-MoE + DS-MCM29.0*35.0*53.0*47.2*41.1*

星号表示论文主表中报告为具有统计显著性的 DS-MCM 提升。

结果说明了什么

  • 相对原始骨干,DS-MCM 的平均分在 Tongyi-DR 上提高 6.2 分,在 MiroThinker-DR 上提高 4.8 分,在 Qwen3-30B-MoE 上提高 13.9 分。
  • 三个骨干模型上,DS-MCM 都超过通用 LLM-as-Critic,说明显式的快慢监控比单纯增加批评调用更有效。
  • Tongyi-DR + DS-MCM 的平均分为 63.2,比表中 GPT-5 参照结果高 2.7 分。

这项工作得到了什么

1

快速监控把推理不确定性与证据状态对齐

Searching Entropy 描述检索文档的语义分散程度,Reasoning Entropy 描述模型推理 token 的不确定性。成功轨迹用来估计两者的正常关系。

2

慢速监控利用成功与失败记忆进行诊断

慢速监控器分别从成功记忆池和失败记忆池中检索相似会话,为批判模型提供与当前步骤直接相关的行为参照。

3

选择性触发把检测连接到控制

快速监控器每一步运行;只有不确定性校准异常时,成本更高的慢速批判过程才会启动。轻量检测与深度反思因此分工明确。

4

分层监控提高深度搜索的稳健性

在多个深度搜索基准和骨干模型上,DS-MCM 都提高了表现。敏感性实验进一步检查熵阈值、检索记忆条数和文档预算。

在整体研究计划中的位置

DS-MCM 是当前项目序列中的元认知调控环节。ReDeEP 分析证据使用,RHD 分析推理动态,ReARTeR 构造过程奖励, DS-MCM 再把这些思路接入监控与纠错循环。

下一步需要让智能体能够检查自己的执行状态。科研、法律和决策支持中的智能体自主性越高,越需要这样一层过程监控来约束长程行为。

资源与引用

@inproceedings{sun2026deep,
  title={Deep Search with Hierarchical Meta-Cognitive Monitoring Inspired by Cognitive Neuroscience},
  author={Sun, Zhongxiang and Wang, Qipeng and Yu, Weijie and Yang, Jingxuan and Lu, Haolang and Xu, Jun},
  booktitle={Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval},
  doi={10.1145/3805712.3809549},
  year={2026}
}