从多模态数据生成忠实且显著的文本
计算机视觉与模式识别
2024-09-09 v1
摘要
虽然大型多模态模型 (LMM) 在许多多模态任务上取得了强大的性能,但它们在生成文本时仍可能出现幻觉。此外,它们在检测视觉数据显著特征方面的表现也不明确。本文我们发展了一个框架,从混合模态数据(包括图像和结构化数据(以知识图谱或表格表示))生成忠实且显著的文本。具体而言,我们训练一个小型视觉批评模型,以识别图像模态中的幻觉和非显著特征。该批评模型还生成一系列显著图像特征列表。此信息用于后编辑步骤以提高生成质量。实验在两个数据集上进行,显示我们的方法在忠实性和显著性方面均优于旨在减少幻觉的最新技术。
引用
@article{arxiv.2409.03961,
title = {Generating Faithful and Salient Text from Multimodal Data},
author = {Tahsina Hashem and Weiqing Wang and Derry Tanti Wijaya and Mohammed Eunus Ali and Yuan-Fang Li},
journal= {arXiv preprint arXiv:2409.03961},
year = {2024}
}