EmoAssist:面向视障社区的情感助理
计算机视觉与模式识别
2025-02-14 v1 计算机与社会
摘要
大型多模态模型(Large Multi-modality Models, LMMs)的快速发展显著推动了人工智能向实际应用的集成。能够处理包括视觉、文本和音频等多模态数据的视觉问答(Visual Question Answering, VQA)系统,对于帮助视障(Visual Impairment, VI)社区在复杂动态的真实环境中导航具有巨大的潜力。然而,现有的视障助理类LMM忽略了视障个体的情感需求,现有基准测试也缺乏对这些LMM进行情感评估。为此,本文引入EmoAssist基准测试,一个全面评估LMM在视障社区中助理性能的基准测试。我们不妨称这是首个将情感智能作为关键考量的基准测试。此外,我们提出EmoAssist模型,一个专为视障社区设计的情感助理型LMM。EmoAssist模型利用直接偏好优化(Direct Preference Optimization, DPO)技术,将输出与人类情感偏好对齐。实验结果表明,EmoAssist模型在识别视障用户的隐含情感与意图方面显著提升,能够提供具有同理心的回应,并提供可操作的指导。具体而言,与在EmoAssist基准测试中进行预调谐的LMM相比,该模型在同理心和建议等指标上分别提升了147.8%和89.7%,甚至超越了如GPT-4o等最先进的大语言模型。
引用
@article{arxiv.2502.09285,
title = {EmoAssist: Emotional Assistant for Visual Impairment Community},
author = {Xingyu Qi and He Li and Linjie Li and Zhenyu Wu},
journal= {arXiv preprint arXiv:2502.09285},
year = {2025}
}