OmniTrace:全模态大语言模型中生成时归因的统一框架
计算与语言
2026-04-16 v1 人工智能
多媒体
摘要
现代多模态大语言模型能够根据交错的文本、图像、音频和视频输入生成流畅的回复。然而,识别哪些输入来源支持每个生成的陈述仍然是一个开放的挑战。现有的归因方法主要针对分类设置、固定预测目标或单模态架构设计,并且不能自然地扩展到执行开放式多模态生成的自回归、仅解码器模型。我们引入了OmniTrace,一个轻量级且模型无关的框架,它将归因形式化为因果解码过程中的生成时追踪问题。OmniTrace提供了一个统一协议,可以在解码过程中将任意的词元级信号(如注意力权重或基于梯度的分数)转换为连贯的跨模态跨度级解释。它将每个生成的词元追溯到多模态输入,将信号聚合成语义上有意义的跨度,并通过置信度加权和时间连贯的聚合选择简洁的支持来源,无需重新训练或监督。在Qwen2.5-Omni和MiniCPM-o-4.5上针对视觉、音频和视频任务的评估表明,与朴素的自我归因和基于嵌入的基线方法相比,生成感知的跨度级归因能产生更稳定和可解释的解释,同时在多种底层归因信号下保持鲁棒性。我们的结果表明,将归因视为一个结构化的生成时追踪问题,为全模态语言模型的透明度提供了一个可扩展的基础。
引用
@article{arxiv.2604.13073,
title = {OmniTrace: A Unified Framework for Generation-Time Attribution in Omni-Modal LLMs},
author = {Qianqi Yan and Yichen Guo and Ching-Chen Kuo and Shan Jiang and Hang Yin and Yang Zhao and Xin Eric Wang},
journal= {arXiv preprint arXiv:2604.13073},
year = {2026}
}