中文

MECap-R1:基于强化学习的情感感知策略用于多模态情感描述

声音 2025-09-24 v1

摘要

情感语音描述(SEC)已成为一个值得关注的研究方向。人类语音中情感内容的内在复杂性使得传统的离散分类方法难以提供充分的表示。因此,利用自然语言来描述语音情感 presents 一种新颖的 avenue,以更有效地捕获和表达情感。本文提出 MECap-R1,一种针对多模态情感描述的情感感知策略与强化学习方法。通过采用情感感知奖励的 Group Relative Policy Optimization(Emo-GRPO),该框架精确捕获情感和语义特征,从而解决了僵化规则在处理描述的动态和灵活性方面的不足。在 EmotionTalk 数据集上的实验结果表明,MECap-R1 在生成情感描述方面表现良好,在准确性和多样性方面实现了显著的提升。

关键词

引用

@article{arxiv.2509.18729,
  title  = {MECap-R1: Emotion-aware Policy with Reinforcement Learning for Multimodal Emotion Captioning},
  author = {Haoqin Sun and Chenyang Lyu and Xiangyu Kong and Shiwan Zhao and Jiaming Zhou and Hui Wang and Aobo Kong and Jinghua Zhao and Longyue Wang and Weihua Luo and Kaifu Zhang and Yong Qin},
  journal= {arXiv preprint arXiv:2509.18729},
  year   = {2025}
}