问题
证据已经出现,模型却没有使用
图中对比了忠实回答的嫦娥六号案例,以及检索证据与参数知识冲突后出现幻觉的超声检查案例。
左侧是一次成功的 RAG。检索文档给出嫦娥六号带回 1935.3 克月球样品,问题询问样品重量,回答复述同一数值并被判为正确。 检索文档、问题、模型和答案在这里保持一致。
右侧正是 ReDeEP 要处理的失败。检索文档说优质超声图像最适合在孕期 20 至 32 周获取,紫色参数知识框给出 24 至 32 周, 最终回答又混入 17 周的条件并被标为幻觉。证据虽然在上下文中,却没有真正控制回答。
- 左例中,绿色检索文档框和黄色回答框的关键数值都是 1935.3 克。
- 右例中,检索文档写的是 20–32 周,参数知识框写的是 24–32 周,回答没有稳定遵循任何一方。
- 这张图提出 ReDeEP 的核心诊断问题:检索完成以后,哪一种信息源真正控制了生成?