中文

Hospitality-VQA:面向视觉语言模型的决策导向信息性评估

人工智能 2026-03-10 v1 机器学习

摘要

近期视觉语言模型(VLM)在通用领域展现出惊人的多模态理解能力,但在面向决策导向的领域如酒店业的适用性尚未得到广泛探索。本文研究 VLM 在关于酒店和设施图像的视觉问答任务中的表现——这些图像是消费者决策的核心。虽然许多现有 VQA 基准关注事实正确性,却很少捕捉用户实际发现有用的信息。为此,我们首次提出信息性(Informativeness)框架,量化图像-问题对提供酒店相关信息的程度。依据该框架,我们构建了覆盖多种设施类型的全新酒店专用 VQA 数据集,问题设计旨�反映关键用户信息需求。使用该基准,我们对几种最新 VLM 进行实验,发现 VLM 在本质上并非决策感知——关键视觉信号仍被低估,唯有在适度的领域特定微调后,才出现可靠的信息性推理能力。

关键词

引用

@article{arxiv.2603.07868,
  title  = {Hospitality-VQA: Decision-Oriented Informativeness Evaluation for Vision-Language Models},
  author = {Jeongwoo Lee and Baek Duhyeong and Eungyeol Han and Soyeon Shin and Gukin han and Seungduk Kim and Jaehyun Jeon and Taewoo Jeong},
  journal= {arXiv preprint arXiv:2603.07868},
  year   = {2026}
}

备注

Accepted at EACL 2026 SRW. 16 pages