Look as You Think: Unifying Reasoning and Visual Evidence Attribution for Verifiable Document RAG vi
文章的核心是解决视觉文档检索增强生成VD-RAG系统中模型推理过程不可验证、缺乏可追溯性的问题。作者提出了一个名为LATLook As You Think的框架通过让模型在回答问题时像人类一样逐步推理并同时标注出每一步所依据的视觉证据从而实现可验证、可信赖的多模态问答。以下是对全文主要研究内容的全面总结与概括1. 研究背景与痛点任务视觉文档RAGVD-RAG即模型根据文档截图如论文、网页回答用户问题并需标注答案来源。核心痛点现有模型如VISA仅将最终答案与证据框关联缺乏中间推理过程的追溯用户无法了解模型是如何得出答案的黑盒。人工标注分步推理数据成本极高难以规模化。现有方法在多图像、跨领域场景下泛化能力弱。2. 提出的新范式Chain-of-Evidence (CoE)核心思想将“思维链”CoT与“视觉证据归因”深度融合。具体形式模型在生成推理步骤时每一步如定位章节→定位段落→定位具体数据都必须附带一个边界框Bounding Box和页码指明该步结论来自图像的哪个区域。目标模仿人类“从粗到细”的观察过程使推理链条完全可追溯、可验证。3. 提出的方法LATLook As You Think框架LAT是一个两阶段训练框架旨在用极少量标注数据通过强化学习RL教会模型生成带证据的推理链。阶段名称核心做法阶段一冷启动 SFT使用大模型Gemini生成少量约1000条带分步证据的CoE样例经人工矫正后用LoRA微调基础VLM使其初步学会CoE的格式和推理模式。阶段二强化学习 RLGRPO在仅使用5%原始数据、无分步标注的情况下通过设计4种奖励函数驱动模型自我优化生成更准确、更忠实于证据的推理路径。4种奖励函数设计准确性奖励Racc评估最终答案是否正确软精确匹配。分步归因奖励Rstep评估每一步推理的文字内容与所框选图像区域是否语义对齐使用多模态检索器计算相似度。同时惩罚重复框选同一区域强制模型进行多样化、递进式的观察。定位奖励Rground评估最终答案的边界框是否与真实证据框高度重叠IoU 0.5。格式奖励Rformat确保输出严格遵守think推理过程和answer答案的标签格式。4. 实验与主要结果基准与模型在VISA基准包含Wiki-VISA和Paper-VISA上进行测试涵盖单图像和多图像场景。基础模型为Qwen2.5-VL-7B。主要发现性能大幅提升相比原始模型LAT在答案准确率EM上平均提升8.23%在证据定位精度IoU0.5上平均提升47.0%。优于SFT基线直接进行有监督微调SFT无法达到LAT的泛化能力LAT在跨领域迁移如从Paper-VISA迁移到Wiki-VISA中表现更优。推理过程可验证LAT生成的分步推理SA指标质量显著高于开源模型和上下文学习ICL方法证明其不仅答案对而且“想”得对。数据高效仅用5%的数据和少量冷启动样本就达到了与使用10万级数据训练的VISA模型相当的性能。5. 核心贡献总结新范式首次在VD-RAG中形式化定义了证据链CoE实现了推理过程与视觉证据的细粒度对齐。新方法提出LAT创新性地将强化学习GRPO应用于视觉证据归因通过过程级奖励分步对齐和结果级奖励答案正确性联合优化无需昂贵的过程标注。实用价值显著提升了模型在复杂多页文档场景下的可解释性和可信度用户能清晰追溯模型每一步推理的依据极大地增强了VD-RAG系统在实际应用中的可靠性。6. 局限与未来方向文中提及阈值依赖奖励函数中的相似度阈值τ是人工设定的未来可探索自适应机制。单跳限制当前VISA数据集主要为单步证据未来需引入多跳推理数据集以验证模型在更复杂跨页推理上的能力。这里是自己的论文阅读记录感兴趣的话可以参考一下如果需要阅读原文的话可以看这里如下所示项目地址在这里如下所示摘要为了从视觉文档中识别精确的证据来源视觉文档检索增强生成VD-RAG中的视觉证据归因对于确保视觉语言模型VLM在多模态问答中提供可靠且可验证的预测至关重要。大多数现有方法采用端到端训练来促进直观的答案验证。然而它们缺乏细粒度的监督以及在推理过程中的渐进式可追溯性。在本文中我们为VD-RAG引入了“证据链”CoE范式。CoE通过将推理步骤中的引用元素参考元素锚定到具有边界框和页码的特定区域统一了“思维链”CoT推理与视觉证据归因。为了使VLM能够生成这种基于证据的推理我们提出了“如同思考般审视”LAT这是一个强化学习框架它训练模型生成具有一致性归因的可验证推理路径。在训练过程中LAT评估每个证据区域的归因一致性并且仅在CoE轨迹产生正确答案时才给予奖励从而鼓励过程级的自我验证。在原始的Qwen2.5-VL-7B-Instruct模型以及Paper-和Wiki-VISA基准上的实验表明LAT在单图像和多图像设置中均能持续提升基础模型的性能在软精确匹配EM上平均提升8.23%在IoU0.5上平均提升47.0%。同时LAT不仅优于直接训练生成带归因答案的有监督微调基线还展现出更强的跨领域泛化能力。1. 引言随着视觉语言模型VLM多模态理解能力的发展视觉文档检索增强生成VD-RAG已成为一个关键的研究前沿。然而当前的VLM仍然容易产生幻觉即其输出可能偏离源文档内容。如果没有可靠的视觉证据归因机制来识别文档中的来源用户就无法直观地追溯模型所使用的特定信息从而降低了VD-RAG系统在实际应用中的可靠性。图1: (a) 人类通过观察并定位文档中的支持性证据来推断信息。(b) 在生成证据链的过程中推理步骤中的每个元素都通过边界框与视觉归因相链接。沿着这一方向近期的研究工作通过关注关键视觉区域作为证据利用大规模的分步证据区域标注缓解了单图像思维链CoT推理中的幻觉问题。VISA进一步将视觉证据归因整合到VD-RAG框架中通过边界框将答案与其支持来源相链接。尽管取得了这些进展但在视觉文档中进行有效的证据归因仍面临挑战1缺乏用于可验证归因的渐进式推理机制。现有方法如VISA直接将答案与最终证据关联但未揭示中间过程而中间过程能帮助用户清晰理解内容并追溯证据的定位方式。相比之下人类在解决复杂问题时并非直接定位证据而是逐步搜索相关信息。如图1a所示这种观察路径的结构化为“章节-段落摘要-具体元素”从粗粒度到细粒度地定位证据。然而当前的VLM难以复制这种渐进式观察过程尤其是在多图像场景下。2学习多模态推理的监督有限。训练模型学习CoT推理需要大量带标注的数据尤其是对于分步证据归因。然而手动构建此类数据集成本高昂。因此如何在有限的标注数据下有效学习分步视觉证据归因并泛化推理能力仍然是一个关键挑战。鉴于这些挑战我们引入了“证据链”CoE这是一种为VD-RAG设计的推理范式它将思维链CoT推理与视觉证据归因相结合。与现有方法在单图像内进行推理或直接将最终答案链接到来源不同CoE通过将每一步都锚定到文档中的支持来源来模拟中间推理轨迹。这种从粗到细的归因过程模仿了人类解决问题的方式并增强了VD-RAG的可靠性。为此我们提出了“如同思考般审视”LAT这是一种两阶段训练方法旨在实现所提出的CoE范式。具体来说在第一阶段我们在一小组经过人工验证的带标注CoE数据上微调VLM以学习推理模式。然后我们通过量身定制的奖励设计在组相对策略优化GRPO算法下采用强化学习RL。模型基于预测的视觉证据与相应上下文之间的语义对齐获得一个分步奖励从而鼓励在无需分步标注的情况下进行忠实推理。此外仅在CoE轨迹产生正确答案时才给予奖励。我们进一步结合了结果奖励以确保答案准确性并指导模型界定答案定位的范围。这种组合奖励方案增强了生成CoE推理的能力从而将子步骤验证与最终任务表现联系起来。我们的贡献总结如下在VD-RAG场景中我们将“证据链”CoE范式形式化将多模态推理建模为一系列有依据的步骤其中引用元素例如图表、表格或事实信息通过边界框和页码与其来源相链接。基于CoE我们提出了LAT这是一种基于强化学习的方法通过分步奖励联合优化推理和视觉定位。通过将每个引用元素与其视觉证据对齐LAT能够使用少量带CoE标注的样本实现具有归因感知的推理。LAT平衡了可追溯性和性能。与基础模型相比它在单图像和多图像场景中平均提升了8.23%的EM和47.0%的IoU0.5。同时LAT不仅优于直接训练生成带归因答案不含CoE推理的有监督微调基线还展现出更强的跨领域泛化能力。2. 相关工作视觉证据归因早期的端到端定位方法通过使用Markdown超链接生成边界框令牌将目标检测集成到生成的文本中。这些方法在大规模带定位标注的图像和文本语料库上进行训练。在此基础上多步视觉定位CoT框架通过在推理过程中预测边界框作为证据将推理和定位交错进行从而产生可解释的推理轨迹。然而这些方法仅在通用视觉感知任务上得到验证并且依赖于大规模标注的证据区域。它们也没有探索涉及异构布局和多页检索的VD-RAG中的视觉证据归因任务。此外文档RAG中现有的基于文本的证据归因方法通常在文档级别操作要求用户阅读整个文档以定位支持内容。VISA首次通过将最终答案与其证据对齐将视觉证据归因适配到文档截图。尽管这种方法实现了正确性的直观验证但它未能阐明模型得出答案所经过的中间推理步骤。这些局限性促使了我们提出CoE推理范式该范式生成忠实的推理步骤并针对每个引用元素与其相应来源进行验证如图1b所示。用于VLM推理的强化学习近年来的研究表明基于强化学习的策略优化可以提升大型语言模型的推理能力。DeepSeek-R1 demonstrated that RL training elicits emergent CoT behaviors in LLMs, revealing the hallmark aha moment. Inspired by this phenomenon, several methods have extended R1-style RL strategies to VLMs, leveraging rule-based reward functions to boost performance on mathematical reasoning and visual perception tasks. Unlike supervised fine-tuning (SFT), RL-based approaches achieve deeper reasoning and stronger generalization without relying on extensive human-annotated data.然而现有的多模态任务RL框架主要针对答案准确性作为奖励信号进行优化缺乏对验证中间推理过程的明确监督并且没有针对VD-RAG中视觉证据归因任务的设计考虑。借鉴人类的阅读策略我们引入了一个分步的、过程级别的奖励该奖励将每个推理步骤与可验证的证据对齐。利用提取的CoE我们明确奖励那些在证据上一致并能得出正确答案的轨迹从而确保有效的推理并促进基于归因的忠实解释。3. 提出的方法为了弥补视觉证据归因缺乏可验证的渐进式推理的缺陷我们首先形式化了“证据链”CoE范式。基于CoE我们提出了LAT一个如图2所示的两阶段基于强化学习的框架。阶段一执行有监督微调以对齐带标注的CoE轨迹阶段二通过带有答案条件的归因奖励进行细粒度的强化学习以细化步骤级别的定位。CoE形式化与符号定义阶段一冷启动数据收集与训练为了使模型具备CoE推理的初步能力我们首先从每个训练数据集中采样 1,000 个样本并使用更强的专有模型Gemini 2.5 Pro通过两个CoE示例作为上下文演示进行提示。该模型生成分步的推理过程每个步骤都标注有边界框证据从而产生一个反映所需推理格式的冷启动语料库。对于每个查询 q 及其对应的响应 y 我们使用召回率指标评估答案质量阶段二通过强化学习统一推理与视觉归因为了模仿图1所示的人类观察过程模型需要提供准确的答案和具有归因意识的CoE推理以识别支持最终答案的证据。我们将总体目标分解为四个子目标答案准确性、分步视觉归因质量、证据定位精度以及结构化输出格式的遵守。相应地我们为基于规则的RL训练设计了四个奖励函数。4. 实验设置数据集我们在VISA基准上进行了实验该基准是首个为真实世界VD-RAG场景中的视觉证据归因而设计的数据集包含三个子集1Wiki-VISA 源自自然问题NQ数据集。VISA渲染维基百科页面并使用边界框标注包含答案的HTML元素。2Paper-VISA 基于PubLayNet构建。VISA在带布局标注的文档上合成问答对。3FineWeb-VISA 通过从FineWeb-edu中选择长度超过50个标记的段落并合成带定位的问答对来扩展。在单图像设置中每个查询配对一个源文档页面、从中提取的简短答案以及一个证据边界框。当扩展到多图像时对于每个查询 q 额外从VISA数据集内由文档截图嵌入DSE检索到的前 K 个截图中随机采样两个文档图像然后与源文档页面合并作为输入。对于无答案场景源文档页面被替换为数据集中一个不相关的页面。示例见附录B中的图5。基线为了评估LAT的有效性我们将其与三类基线进行了比较1专有和开源模型包括Gemini、Qwen-VL Max、mPLUG-DocOwl2、InternVL2.5、LLaVA-OneVision和Qwen2.5-VL。2推理模型包括通过SFT在CoT数据上训练的LLaVA-CoT以及在通用场景中通过RL优化的R1-OneVision。3归因监督模型VISA-7B训练用于生成带有直接归因的答案。这些模型作为基线用于评估LAT是否在有限监督下平衡了答案准确性与归因并实现了CoE推理。训练细节评估我们从三个维度衡量性能答案准确性、证据定位和分步归因质量。具体来说我们使用软精确匹配EM报告答案准确性并通过计算IoU0.5评估定位精度该指标衡量预测框 Bans 与真实证据框的IoU超过0.5的比例。为了评估分步视觉归因的质量我们采用了分步归因SA奖励函数。我们在公式8中采用默认阈值 τ0.3 来判断一个步骤是否被正确验证。遵循VISA的评估方法我们在两种设置下评估了Paper-和Wiki-VISA数据集上的性能。1单图像模型仅提供源文档并在三个维度上进行评估。2多图像模型还需从一组检索到的候选中识别出源文档。为了可重复性我们在评估过程中采用贪婪解码作为解码策略。5. 结果与分析主要结果领域内和跨领域设置下的归因感知性能。为了同时评估答案准确性和归因精度我们在直接答案和归因感知设置下评估了模型。我们将领域内设置定义为在与训练数据分布相同的数据集上进行评估。如表1所示在领域内数据上训练的LATLAT-Ind.优于开源模型。与基础模型相比LAT通过CoE引导的RL优化归因感知推理同时提升了答案正确性EM7.95%和证据定位IoU0.544.6%。这些改进在多页场景中尤为明显因为证据选择的复杂性突显了我们方法的优势。特别是在无法回答的情况下LAT输出“No answer”并达到 65% 的平均精度突显了其处理此类场景的鲁棒性。表2突显了LAT在提升CoE推理质量方面的有效性。为了评估上下文学习ICL的影响我们包含了一个带标注的CoE示例作为提示。虽然这带来了适度的改进SA4.0%表明演示可以部分引导结构化推理的生成但对最终结果的影响有限。LAT实现了显著的SA增益37.5%展示了其准确锚定每个推理步骤的能力。此外LAT保持了高答案准确性表明忠实推理与正确结果之间存在一致性。为了评估跨领域泛化能力我们在所有数据集的采样子集上训练了LAT-Full。与领域内变体相比LAT-Full显示出进一步的改进例如Wiki-VISA多图像IoU0.5: 38.0%→41.4%SA: 71.8%→75.2%展示了跨不同文档分布的泛化能力。有限监督下的CoE推理性能。与依赖大规模10万监督数据并将最终答案直接链接到支持证据无推理过程的VISA不同LAT在RL阶段仅使用 5% 的原始问答对进行训练。在低资源环境下LAT在答案准确性和归因精度方面达到了与VISA-7B相当的性能同时保持了可追溯的CoE推理。值得注意的是在高分辨率的Wiki-VISA图像上LAT在有限监督下优于VISA-7B展示了在视觉复杂场景中的鲁棒性。为了确保公平比较我们使用VISA的监督协议在与我们方法相同的数据子集和实验设置下训练了一个SFT基线。图3a显示LAT在答案准确性和证据精度方面均表现优异在多图像设置中改进更为显著图3b。同时表3突显了LAT在不同数据集间的泛化能力在“Paper → Wiki”迁移设置中EM提升了 1.7%IoU0.5提升了 6.2%优于SFT同时保留了基础模型在Wiki-VISAEM: 67.7%和Paper-VISAEM: 38.2%上的性能。这表明LAT在不牺牲对不同数据类型适应性的前提下提升了迁移效果。消融研究奖励组件的有效性。我们在两个数据集上进行了消融实验以检验奖励公式中各独立组件的贡献表4。我们首先分析了基于带标注CoE推理轨迹进行蒸馏的影响。在冷启动阶段通过微调得到的模型 MdistMdist与基础模型相比平均提升了 6.48% 的EM和 20.9% 的IoU0.5。这表明蒸馏有助于提升对CoE推理格式的遵循度。进一步分析6. 结论在本文中我们引入了“证据链”CoE一种将思维链与分步视觉证据归因相统一的推理范式。为了实现CoE我们提出了“如同思考般审视”LAT这是一个强化学习框架它对齐中间过程以缓解VD-RAG中视觉证据归因任务的无依据推理。通过在GRPO算法下结合分步奖励LAT促进了每个推理步骤的验证。在Paper-和Wiki-VISA上的实验表明LAT优于基线。我们希望这项工作能激发进一步关于增强VD-RAG系统可验证性的研究。