中文

HumanSense:从多模态感知到通过推理获取同理心的情境感知响应

计算机视觉与模式识别 2025-12-16 v4

摘要

尽管多模态大语言模型(MLLMs)在实现真正的人类化交互方面显示出巨大的潜力,但由于缺乏针对人类中心场景的细粒度评估框架——涵盖对复杂人类意图的理解以及对提供同理心、情境感知响应的能力——进展受到限制。本文引入HumanSense,一个全面的基准测试,旨在评估MLLMs的人类中心感知与交互能力,特别关注对扩展多模态情境的深层理解以及制定合理反馈的能力。我们的评估表明,领先的MLLMs仍有相当大的提升空间,尤其是针对高级交互导向任务。将视觉输入补充以音频和文本信息可显著提升表现, Omni-modal模型在这些任务中表现出优势。进一步地,基于“合适的反馈源于对交谈者需求和情绪的情境性分析”这一观察,我们认为推理能力是 unlocking 这些能力的关键。我们设计了一种多阶段、模态渐进式的强化学习方法,得到HumanSense-Omni-Reasoning,显著提升了对高级理解和交互任务的性能。此外,我们观察到成功的推理过程呈现出一致的思考模式。通过设计相应的提示,我们也以训练无监督方式提升了非推理模型的性能。项目页面:\textcolor{brightpink}{https://digital-avatar.github.io/ai/HumanSense/}

关键词

引用

@article{arxiv.2508.10576,
  title  = {HumanSense: From Multimodal Perception to Empathetic Context-Aware Responses through Reasoning MLLMs},
  author = {Zheng Qin and Ruobing Zheng and Yabing Wang and Tianqi Li and Yi Yuan and Jingdong Chen and Le Wang},
  journal= {arXiv preprint arXiv:2508.10576},
  year   = {2025}
}

备注

Accepted by AAAI2026