HumanSense:从多模态感知到通过推理获取同理心的情境感知响应
计算机视觉与模式识别
2025-12-16 v4
摘要
尽管多模态大语言模型(MLLMs)在实现真正的人类化交互方面显示出巨大的潜力,但由于缺乏针对人类中心场景的细粒度评估框架——涵盖对复杂人类意图的理解以及对提供同理心、情境感知响应的能力——进展受到限制。本文引入HumanSense,一个全面的基准测试,旨在评估MLLMs的人类中心感知与交互能力,特别关注对扩展多模态情境的深层理解以及制定合理反馈的能力。我们的评估表明,领先的MLLMs仍有相当大的提升空间,尤其是针对高级交互导向任务。将视觉输入补充以音频和文本信息可显著提升表现, Omni-modal模型在这些任务中表现出优势。进一步地,基于“合适的反馈源于对交谈者需求和情绪的情境性分析”这一观察,我们认为推理能力是 unlocking 这些能力的关键。我们设计了一种多阶段、模态渐进式的强化学习方法,得到HumanSense-Omni-Reasoning,显著提升了对高级理解和交互任务的性能。此外,我们观察到成功的推理过程呈现出一致的思考模式。通过设计相应的提示,我们也以训练无监督方式提升了非推理模型的性能。项目页面:\textcolor{brightpink}{https://digital-avatar.github.io/ai/HumanSense/}
引用
@article{arxiv.2508.10576,
title = {HumanSense: From Multimodal Perception to Empathetic Context-Aware Responses through Reasoning MLLMs},
author = {Zheng Qin and Ruobing Zheng and Yabing Wang and Tianqi Li and Yi Yuan and Jingdong Chen and Le Wang},
journal= {arXiv preprint arXiv:2508.10576},
year = {2025}
}
备注
Accepted by AAAI2026