我把幻觉视为内部功能组织、模块路径、推理动态、记忆与事实冲突以及过程控制失效的外部信号。
研究计划
AI 智能体的认知神经科学
AI 智能体已经能够推理、调用记忆与工具、同人持续交互,并围绕长期目标采取行动。 我的长期研究关注这些系统的智能、知识、价值和行动结构怎样形成、组织与变化,以及它们如何影响行为。 现阶段,我从具体故障入手,分析异常怎样沿目标、证据、记忆、工具反馈和行动过程传播, 再研究智能体能否在执行过程中发现问题并完成纠正。
为什么需要这项研究
AI 智能体把推理、记忆、工具调用和持续行动组合在同一个系统中。 这带来了一组具体问题:行为异常由哪些内部状态引起,局部故障怎样沿长程任务传播,系统又能否在执行中及时纠正。 评测、可解释性和安全研究已经提供了行为测量、机制定位和风险约束方法。我希望把这些方法连起来,追踪智能体从内部组织到持续行动的完整过程。
新的研究对象
智能体把感知、语言、推理、记忆、工具调用、长期目标和多智能体协作组合在一起, 也开始参与数据生成、评测设计、工具链优化和模型改进。
分散的既有解释
评测描绘行为边界,可解释性追踪内部机理,安全与对齐研究监督和约束。 我的研究把这些线索放进同一套系统分析中,考察内部组织如何转化为持续行动。
反复出现的问题
推理失真、知识误用、目标漂移和行动失控看似发生在不同模块,背后都涉及能力、知识、 偏好和行为策略如何形成、更新与失效。
需要组合的方法
认知任务设计、行为分析、表征分析、机理干预和过程监控共同构成实验闭环, 用来回答“系统何时出错、错误在哪里形成、干预后是否真正改变行为”。
长期社会影响
当智能体逐渐走向自主化、社会化、具身化和自我改进,我们需要能够检查内部状态、 引导行为并研究人机长期共存的科学工具。
研究对象:作为复杂智能系统的 AI 智能体
早期人造智能系统通常有较清楚的任务、能力和行为边界。今天的 AI 智能体通过大规模训练、 后训练、工具交互、记忆和环境反馈形成能力。它们可以跨任务迁移,拆解长期目标,调用外部工具, 与其他智能体协作,并对现实环境产生连续影响。
因此,我研究的是智能体本身的组织方式:人工系统怎样组织不同能力,怎样存储和调用知识, 怎样形成目标与偏好,又怎样把模型内部的计算转化为持续行动。这个对象需要系统层面的解释, 因为一次输出只是行为链条的末端。
四类相互关联的问题
我把 AI 智能体的研究整理为智能结构、知识结构、价值结构和行动结构四组问题。 每一组都对应可观察的行为、需要定位的内部机理,以及可以检验的干预方式。
智能结构
推理、规划、记忆、抽象、工具使用和长程任务组织能力,会在训练与交互中逐步形成。 我关注这些能力怎样出现和泛化,又为什么会波动或突然失效。
- 哪些内部结构支持推理、规划与工具使用?
- 什么条件会让一种能力保持稳定、变得脆弱或产生误导?
- 后训练与环境交互如何改变能力的调用方式?
知识结构
智能体内部可能已经形成自然语言提示难以完整调出的知识结构。我研究知识存在哪里、 如何组织和调用,以及怎样把内部知识转译为人能够检查的证据。
- 事实知识、程序知识和任务知识分别如何组织?
- 外部证据、参数知识与个性化记忆怎样共同影响回答?
- 如何检验内部知识的可靠性,并将其转化为可核查的表达?
价值结构
智能体的目标、偏好与行为倾向由训练目标、奖励模型、人类反馈、部署环境和社会交互共同塑造。 我希望测量这类结构的变化,并研究可行的引导方式。
- 奖励信号与反馈怎样塑造相对稳定的行为倾向?
- 价值相关表征如何与任务结构和知识结构相互作用?
- 过程监控能否及时发现目标导向行为的偏移?
行动结构
工具调用、外部记忆、多智能体协作、具身接口和环境反馈,把模型内部计算接入真实世界。 我研究行动过程怎样组织,又怎样被监控、纠正和持续更新。
- 模型能力如何变成外部环境中的连续行动?
- 工具接口和记忆系统如何重塑智能体行为?
- 智能体能否在执行中监控、反思、纠错并积累经验?
方法闭环
认知神经科学提供了一套研究复杂智能系统的实验思路:从行为出发设计任务,观察内部表征, 再通过干预判断相关线索是否具有因果作用。我把这套思路用于 AI 智能体,形成下面的研究闭环。
设计能够显露能力边界、策略变化和错误结构的任务。
测量能力何时稳定、何时迁移,以及在什么条件下失效。
定位功能分区、路径失衡、时间动态和记忆与事实之间的冲突。
通过消融、表征引导、路径评分、奖励塑形和环境改变检验机理。
把诊断结果用于过程监控、反思纠错、过程奖励和经验更新。
我的工作流程是:用任务定义能力,用行为刻画边界,用表征分析定位结构, 用干预验证机理,再通过过程监控把机理分析接回可靠行动。
博士阶段研究主线
我的博士研究从幻觉切入。幻觉是一种可见的故障信号,可以追溯到内部功能组织、模块间路径失衡、 知识调用、记忆干扰、推理动态和长程过程控制。现有工作沿三层路径展开:先解释模型内部的认知坐标系, 再定位智能体核心模块中的故障,最后用元认知机制调控长程执行。
NeuroCogMap 构建模型认知、能力层级和异常定位的内部坐标系。
ReDeEP、RHD 和 FPPS 分别定位证据使用、推理时间动态与个性化记忆中的故障。
ReARTeR 和 DS-MCM 研究过程奖励、分层监控、反思纠错与经验更新。
每项工作都从一个能显露故障的任务开始,经由行为测量和内部定位检验机理,再据此设计调控方法。
这些工作覆盖多个智能体核心模块,并把局部机理诊断逐步接到长程执行调控上。
这套研究尝试回答故障在哪里形成、怎样传播,以及调控机制应当介入哪个环节。
解释:内部认知组织
NeuroCogMap Reveals Cognitive Organization of Large Language Models
arXiv 2026 | 项目负责人
NeuroCogMap 为我的博士研究提供一套解释坐标。它把大语言模型视为可通过实验研究的人工认知系统, 考察内部功能组织如何解释正常行为、异常行为、与人类皮层的对应关系,以及认知模型的发现过程。
定位:智能体模块机理
ReDeEP: Detecting Hallucination in Retrieval-Augmented Generation via Mechanistic Interpretability
ICLR 2025 Spotlight | 第一作者
ReDeEP 研究检索增强生成中的工具与证据使用幻觉。它分离对外部证据敏感的通路和参数知识通路, 在模型内部定位失效信号,并利用这套机制进行幻觉检测与干预。
Mechanistic Detection and Mitigation of Hallucination in Large Reasoning Models
ICLR 2026 | 第一作者
RHD 将幻觉分析从最终答案推进到完整推理轨迹。它刻画多步推理中的早期波动、浅层模式匹配、错误回溯和伪验证, 再用过程级奖励约束缓解这些失效。
When Personalization Misleads: Understanding and Mitigating Hallucinations in Personalized LLMs
ACL 2026 Findings | 第一作者
FPPS 研究个性化诱发的幻觉。它分析长期用户历史和偏好信号如何与事实表征纠缠, 并通过推理时表征调控,在保留个性化能力的同时减少事实偏移。
调控:元认知调控
ReARTeR: Retrieval-Augmented Reasoning with Trustworthy Process Rewarding
SIGIR 2025 | 第一作者
ReARTeR 从过程层面提高检索增强推理的可靠性。它结合标量过程奖励、与评分对齐的自然语言解释、考虑偏差的前瞻搜索和逐步后训练, 同时改进中间推理和最终答案。
Deep Search with Hierarchical Meta-Cognitive Monitoring Inspired by Cognitive Neuroscience
SIGIR 2026 | 第一作者
DS-MCM 将元认知监测引入长程搜索智能体。框架加入快速监测、较慢的反思诊断和经验更新, 使智能体能够发现异常、分析原因、修正执行,并在后续任务中复用经验。
研究进程
这项研究从当前的幻觉机理逐步扩展到更自主的 AI 智能体。近期分析系统性故障, 中期研究内部知识的定位和转译,长期则为理解人类与智能体共同生活和工作提供可检验的依据。
理解系统性故障
从可观察行为追溯反复出现的错误,定位内部组织、模块机理和过程控制中的具体问题。
定位并转译内部知识
研究复杂知识在哪里组织、如何调用与重组、是否可靠,以及怎样转化为人可以核查的证据。
支持人类与智能体共存
为能够形成目标、使用工具并进入社会系统的智能体建立分析与引导方法,使长期行动与人类价值保持联系。
下一步:从智能体科学走向 AI4Science
下一阶段有两条相互衔接的工作线。第一条把博士阶段的幻觉机理研究扩展到智能、知识、价值和行动结构; 第二条把同一套实验闭环用于科学发现智能体。这类智能体需要检索文献,操作分析工具和模拟器,跨尺度推理, 提出假设并设计实验。我希望把它们的发现过程变成可以检查、可以做因果检验,也可以在出错后纠正的研究对象。
智能结构
描绘推理、规划、记忆、抽象和工具使用如何形成稳定能力,并比较这些能力在不同任务中的失效模式。
知识结构
定位、检验并转译内部知识,让人能够检查仅靠表层提示无法完整调出的知识结构。
价值与行动结构
研究目标、偏好、工具接口、社会反馈和环境交互如何塑造持续行动,并设计相应的监控与调控方法。
科学发现智能体
构建科学发现智能体,将文献检索、数据分析、模拟反馈、假设生成和实验规划组织成可检查的发现过程。