中文

解码情感表达:基于高效对齐的人类偏好客观化框架

声音 2025-10-24 v1 计算与语言 机器学习

摘要

最近的语音到语音(S2S)模型生成清晰的语音,但仍缺乏自然的情感表达,主要由于缺乏可靠的评估指标。现有的做法,如主观MOS评级、低层声学特征和情感识别,成本高、受限或不完整。为此,我们提出了DeEAR(Decoding the Expressive Preference of eAR,解码情感表达偏好)框架,将人类对语音情感表达的偏好转化为客观分数。以音韵学和心理学为基础,DeEAR在情感、抒情和自发性三个维度上评估语音,通过不足500个标注样本即可实现与人类感知强对齐(斯佩尔曼等级相关系数SRCC = 0.86)。除了可靠的评分方法外,DeEAR还能实现公平的基准测试和针对性数据 curated。它不仅能区分S2S模型之间的情感表达差距,还选出14K条情感表达语句,构建ExpressiveSpeech数据集,使S2S模型的情感表达得分从2.0提升至100分制上的23.4。演示和代码已在https://github.com/FreedomIntelligence/ExpressiveSpeech提供。

关键词

引用

@article{arxiv.2510.20513,
  title  = {Decoding the Ear: A Framework for Objectifying Expressiveness from Human Preference Through Efficient Alignment},
  author = {Zhiyu Lin and Jingwen Yang and Jiale Zhao and Meng Liu and Sunzhu Li and Benyou Wang},
  journal= {arXiv preprint arXiv:2510.20513},
  year   = {2025}
}

备注

Submitted to ICASSP 2026. Demos and codes are available at https://github.com/FreedomIntelligence/ExpressiveSpeech