智能体模块机理

When Personalization Misleads: Understanding and Mitigating Hallucinations in Personalized LLMs

FPPS 研究个性化诱发的幻觉。它分析长期用户历史和偏好信号如何与事实表征纠缠, 并通过推理时表征调控,在保留个性化能力的同时减少事实偏移。

ACL 2026 Findings 第一作者 Zhongxiang Sun, Yi Zhan, Chenglei Shen, Weijie Yu, Xiao Zhang, Ming He, Jun Xu
FPPS

从表征层面解释个性化记忆如何使事实行为发生偏移。

个性化语言模型如何既服务于用户特定任务,又不让用户历史扭曲客观事实?

从研究问题到机制与证据

下面按论文的图表顺序展开。每一节都说明这张图回答了什么问题,又支持了哪一步结论。

1

问题

个性化何时开始覆盖事实

图中依次比较普通 LLM、产生个性化幻觉的个性化 LLM,以及加入 FPPS 后的个性化 LLM。

FPPS 个性化何时开始覆盖事实图示

顶部是普通 LLM 对两类问题的回答。面对关于纽约第 161 志愿步兵团的事实问题,模型回答“1861 年亚伯拉罕·林肯就职”; 面对濯足星期四礼拜的个性化问题,由于没有聊天历史,模型无法作答。两种情况分别对应图中的事实查询和个性化查询。

中间加入聊天历史:用户是圣公会教徒,历史中还包含第一次世界大战语境。模型因此能回答个性化问题,却把事实答案改成“伍德罗·威尔逊” 和第一次世界大战,产生个性化诱发的幻觉。底部是 FPPS 的目标:保留正确的个性化回答,同时把事实答案恢复为林肯就职。

读图要点
  • 蓝色 Fact Query 框对应事实问答,粉色 Personalized Query 框对应依赖用户历史的回答。
  • 中间一行是故障:聊天历史帮助了个性化问题,却污染了事实问题。
  • 底部方向盘图标表示 FPPS,它要把这两种影响分开处理。
2

机制

事实性与个性化方向并不总能分开

左图画出事实表征、个性化表征及其纠缠方向;右图比较幻觉样本与忠实样本的余弦相似度。

FPPS 事实性与个性化方向并不总能分开图示

左侧示意图定义了几何关系:蓝色事实表征向上,粉色个性化表征斜向伸出,纠缠后的表征位于两者之间。夹角 θ 描述事实方向与 个性化方向的关系,旁边括号标出由此产生的事实偏移。

右侧小提琴图检验这一几何解释,比较幻觉与忠实样本的余弦相似度,并给出 Welch t 检验。忠实样本与目标方向的相似度更高, 幻觉样本的表征偏移更明显。

读图要点
  • 左图中的 θ 和 factual distortion 括号对应隐藏状态的几何假设。
  • 右侧小提琴图把这种几何差异与实际的忠实、幻觉样本联系起来。
  • 故障在解码前已经进入表征,因此干预也应发生在表征层。
3

受控实验

个性化教师会传递事实偏差

控制实验用教师与学生的交互检验个性化是否会改变用户模型学到的事实知识。

FPPS 个性化教师会传递事实偏差图示

小模型扮演用户,大模型扮演教师。实验先去除用户模型已经会回答的问题,再把剩余事实问题与 PFQABench 的个性化历史配对。 用户模型分别与普通教师或个性化教师进行多轮学习。

对话结束后的用户回答用于测量知识获得。不同教师与学生模型组合中,由个性化 LLM 教授的用户模型事实准确率更低, 论文报告平均下降 10.5%。这说明表征纠缠还会影响后续知识学习。

读图要点
  • 沿两种教师条件阅读:普通 LLM 与检索用户历史后的个性化 LLM。
  • 用户模型在学习对话结束后才接受评估,因此结果测量的是知识传递,不是教师当下回答的准确率。
  • FPPS 既要保护当前答案,也要减少错误事实传给用户模型的可能。
4

方法

事实保持的个性化引导

方法图分为三个阶段:离线层选择、离线探针检测,以及推理时的自适应引导。

FPPS 事实保持的个性化引导图示

阶段 1 在各层比较“问题 + 用户信息 + 标准答案”和“问题 + 标准答案”,分别计算加入、去掉用户信息后的 PPL 及其相对偏差, 然后选出层 L。这个阶段定位个性化最明显改变事实预测的位置。

阶段 2 在选定层训练逻辑回归探针,正样本是事实受损状态,负样本是个性化有益状态。阶段 3 在推理时使用探针:若预测概率 p-hat 超过阈值 tau,FPPS-H 减去用户历史方向;否则 FPPS-S 用事实引导方向 s_f 组合事实与个性化信息,再生成回答。

读图要点
  • 阶段 1 根据 PPL 偏差选层,这一步不是训练分类器。
  • 阶段 2 在选定层区分事实受损状态和个性化有益状态。
  • 阶段 3 根据检测风险选择干预:高纠缠使用 FPPS-H,较低风险使用 FPPS-S。
5

结果

用更长历史检验事实鲁棒性

三幅图分别给出 LLaMA3.1-8B-IT、Qwen2.5-7B-IT 和 Qwen2.5-14B-IT 的 F-Score 随历史长度比例变化的曲线。

FPPS 用更长历史检验事实鲁棒性 (a) LLaMA3.1-8B-IT子图

(a) LLaMA3.1-8B-IT

FPPS 用更长历史检验事实鲁棒性 (b) Qwen2.5-7B-IT子图

(b) Qwen2.5-7B-IT

FPPS 用更长历史检验事实鲁棒性 (c) Qwen2.5-14B-IT子图

(c) Qwen2.5-14B-IT

每幅图都比较虚线 Base Model 与实线 Base+FPPS-M。(a) 中,历史比例增加时 LLaMA 基线明显下降,FPPS-M 曲线仍靠近坐标轴顶部; (b) 在 Qwen2.5-7B-IT 上出现类似分离;(c) 的差距较小,但方向一致。

横轴就是历史长度比例,因此实验直接检验更多用户历史是否会施加更强的事实干扰。三种模型上虚线与实线持续分离,说明 FPPS-M 能提高长个性化上下文中的事实稳定性。

读图要点
  • 虚线表示未引导的基础模型,带三角标记的实线表示 Base+FPPS-M。
  • LLaMA3.1-8B-IT 的退化最明显,基础曲线随历史比例增加而下降。
  • 三幅图共同检验 FPPS-M 在更长个性化上下文中的事实问答稳定性。
6

结果

控制个性化模拟中的缓解效果

柱图在多组 UI/FI 模型设置下比较控制组、实验组和实验组加 FPPS 的准确率。

FPPS 控制个性化模拟中的缓解效果图示

分组柱分别表示蓝色 Control、粉色 Experimental 和绿色 Experimental+FPPS。横轴给出 UI/FI 模型组合,例如 LLaMA3.2-1B 搭配 Qwen2.5-14B,或搭配 LLaMA3.1-8B。

柱顶数值显示,实验组准确率往往低于控制组;加入 FPPS 后,多组设置得到部分恢复,绿色柱明显高于粉色柱的位置最直观。 该实验以教学式个性化模拟补充历史长度结果,检查引导能否减轻知识传递中的事实损失。

读图要点
  • 在每个模型组合内比较粉色柱和绿色柱,可以看到 FPPS 恢复准确率的位置。
  • 细小差异应以柱顶数值为准,不宜只凭高度判断。
  • 这组控制实验与图 5 检验的是同一机制,但实验条件更可控。

主要实验结果

PFQABench 同时测量个性化效用 P-Score 和事实可靠性 F-Score。下表聚焦联合指标 Overall,在三个骨干模型上比较各个性化基线 与其自适应 FPPS-M 版本。

PFQABench Overall 得分(%)

个性化方法LLaMA BaseLLaMA +MQwen-7B BaseQwen-7B +MQwen-14B BaseQwen-14B +M
PAG32.260.835.863.836.864.8
DPL24.657.633.858.235.056.8
RAG22.257.638.056.434.458.0
LLM-TRSR23.052.621.054.624.640.4

Overall 是论文联合衡量事实性和个性化的指标;Base 与 +M 分别表示原个性化系统和加入 FPPS-M 的版本。

结果说明了什么

  • 在主表列出的 12 组骨干模型与个性化方法组合中,FPPS-M 都提高了 Overall。
  • 提升主要来自事实表现恢复,同时保留了比强制硬引导更多的个性化效用。
  • PAG、DPL、RAG 和 LLM-TRSR 上方向一致,说明 FPPS 是通用的推理时控制层,并不依赖某一种个性化方法。

这项工作得到了什么

1

个性化带来事实性权衡

个性化可以提高回答与用户的匹配程度,但客观事实与记忆上下文冲突时,事实可靠性可能下降。

2

故障可以在表征几何中观察到

论文把个性化幻觉解释为隐藏状态纠缠。个性化与事实性并不总是两条独立方向,它们可能在解码前就相互作用并造成偏置。

3

选择性引导可以保留有用的个性化

FPPS 通过层选择和事实风险探针判断是否需要干预,比删除全部用户历史或关闭个性化更细致。

4

历史越长,越需要显式监控

历史长度实验和控制模拟表明,记忆持续积累时,个性化风险可能随之增加。短提示中的干扰尚可控制,长期助手则需要专门检查记忆 如何改变事实行为。

在整体研究计划中的位置

FPPS 把个性化记忆模块纳入“AI 智能体认知神经科学”研究,分析累积的用户历史怎样逐步改变内部表征和事实行为。

长期助手、推荐智能体、法律智能体和科研智能体都需要记忆。它们也必须判断记忆何时应影响回答,何时应让可核验事实占主导。

资源与引用

@inproceedings{sun2026personalization,
  title={When Personalization Misleads: Understanding and Mitigating Hallucinations in Personalized LLMs},
  author={Sun, Zhongxiang and Zhan, Yi and Shen, Chenglei and Yu, Weijie and Zhang, Xiao and He, Ming and Xu, Jun},
  booktitle={Findings of the Association for Computational Linguistics: ACL 2026},
  pages={8041--8060},
  year={2026}
}