面向成本感知的多模态问答中的价值信息引导的保真度选择
计算机视觉与模式识别
2026-02-04 v1 人工智能
机器学习
摘要
尽管检索和处理高保真度视觉输入成本高昂,但大多数多模态视觉语言系统均以固定保真度运行。我们引入 VOILA(Value-Of-Information Guided Fidelity Selection),这是一种基于价值信息驱动的自适应保真度选择框架,用于视觉问答(VQA)。VOILA 在给定查询后,使用两阶段管道:梯度提升回归器仅从问题特征估计各保真度的正确性概率,然后使用等辆校准器细化这些概率以实现可靠决策。系统选择在预测准确率和检索成本给定的前提下,使总体效用最大化的最小成本保真度。我们在五个数据集(VQA-v2、GQA、TextVQA、LoCoMo、FloodNet)上评估了 VOILA,涵盖六种视觉语言模型(VLMs),参数规模从 7B 到 235B。VOILA 在多样化查询类型和模型架构下,持续实现 50-60% 的成本降低,同时保留 90-95% 的全分辨率准确率,表明在资源受限条件下,预检索保真度选择对于优化多模态推理至关重要。
引用
@article{arxiv.2602.03007,
title = {VOILA: Value-of-Information Guided Fidelity Selection for Cost-Aware Multimodal Question Answering},
author = {Rahul Atul Bhope and K. R. Jayaram and Vinod Muthusamy and Ritesh Kumar and Vatche Isahagian and Nalini Venkatasubramanian},
journal= {arXiv preprint arXiv:2602.03007},
year = {2026}
}