中文

表面化变以校准 MLLM 生成图像描述的感知可靠性

人机交互 2025-07-22 v1

摘要

多模态大语言模型 (MLLM) 为盲人和低视力人群 (BLV) 提供了获取日常生活中视觉信息的新机会。然而,这些模型常常会产生难以在没有视力的情况下检测的错误,可能在从药物识别到穿搭选择等场景中造成安全和社交风险。虽然 BLV MLLM 用户会使用创造性的变通办法,例如在不同工具之间交叉检查和咨询视力正常者,但这些方法往往耗时且不切实际。我们探讨了如何通过系统性地呈现 MLLM 多个响应之间的变体,从而支持 BLV 用户在不目视检查图像的情况下检测不可靠信息。我们贡献了一个用于激发和呈现变体的设计空间、一个实现了三种变体呈现样式的原型系统,以及来自 15 名 BLV 参与者的用户研究结果。我们的结果表明,呈现变体显著提高了用户识别不可靠主张的能力(使用我们的方法相对于单一描述提升了 4.9 倍),并显著降低了 MLLM 响应的感知可靠性。14 名受试者偏好看到 MLLM 响应的变体而非单一描述,所有受试者都表示对用于理解龙卷风路径或在社交媒体上发布图像等任务中使用该系统感兴趣。

关键词

引用

@article{arxiv.2507.15692,
  title  = {Surfacing Variations to Calibrate Perceived Reliability of MLLM-generated Image Descriptions},
  author = {Meng Chen and Akhil Iyer and Amy Pavel},
  journal= {arXiv preprint arXiv:2507.15692},
  year   = {2025}
}

备注

18 pages, 6 figures