VisMoDAl:用于评估和改进视觉语言模型感知鲁棒性的可视化分析框架
人机交互
2025-09-19 v1 人工智能
机器学习
摘要
视觉语言(VL)模型因其理解多模态信息的能力,在多个关键领域展现出变革性潜力。然而,其性能在分布偏移下常常下降,这使得评估和改进其对实际应用中遇到的数据损坏的鲁棒性至关重要。虽然VL基准数据集和数据增强(DA)的进步为鲁棒性评估和改进做出了贡献,但仍面临对模型行为缺乏深入理解以及需要专业知识和迭代努力来探索数据模式的挑战。鉴于可视化在解释复杂模型和探索大规模数据方面的成就,理解各种数据损坏对VL模型影响,自然与可视化分析方法相吻合。为此,我们引入VisMoDAl——一个面向评估VL模型对各种损坏类型鲁棒性并识别表现不佳样本以指导有效DA策略开发的可视化分析框架。在文献综述和专家讨论基础上,VisMoDAl支持从检查特定损坏下的性能到基于任务的模型行为检查及其对应数据切片的多层次分析。不同于传统方法,VisMoDAl使用户能够洞察损坏对VL模型的影响,促进模型行为理解和DA策略制定。通过聚焦图像描述任务中感知鲁棒性的案例研究和定量评估,展示了本系统的实用性。
引用
@article{arxiv.2509.14571,
title = {VisMoDAl: Visual Analytics for Evaluating and Improving Corruption Robustness of Vision-Language Models},
author = {Huanchen Wang and Wencheng Zhang and Zhiqiang Wang and Zhicong Lu and Yuxin Ma},
journal= {arXiv preprint arXiv:2509.14571},
year = {2025}
}
备注
11 pages, 7 figures, 1 table, accepted to IEEE VIS 2025 (IEEE Transactions on Visualization and Computer Graphics)