AEQ-Bench:衡量 Omni-Modal 大模型同理心
计算与语言
2026-01-16 v1 人机交互
摘要
虽然对 omni-modal 大模型(OLMs)的自动评估至关重要,但由于其内在的情感性质,评估同理心仍是一个重大挑战。为调查这一挑战,我们引入 AEQ-Bench(Audio Empathy Quotient Benchmark),这是一个新颖的基准测试,用于系统性评估 OLMs 两项核心同理心能力:(i) 通过理解来自多模态输入(音频 + 文本)中的情感线索来生成同理心回应,以及 (ii) 在不依赖文本转录的情况下对音频回应的同理心进行判断。与现有基准测试相比,AEQ-Bench 包含两种新颖设置,分别在情境特异性和语音语调方面存在差异。全面的跨语言和准语言指标评估显示:(1)训练有音频输出能力的 OLMs 通常优于仅使用文本输出的模型,(2)虽然 OLMs 在粗粒度质量评估方面与人类判断一致,但在评估细粒度准语言表达方面仍不可靠。
关键词
引用
@article{arxiv.2601.10513,
title = {AEQ-Bench: Measuring Empathy of Omni-Modal Large Models},
author = {Xuan Luo and Lewei Yao and Libo Zhao and Lanqing Hong and Kai Chen and Dehua Tao and Daxin Tan and Ruifeng Xu and Jing Li},
journal= {arXiv preprint arXiv:2601.10513},
year = {2026}
}