ADEPT:基于证据探测工具的情感推理RL对齐代理解码 -- 从共识学习到模糊动力情感推理
机器学习
2026-02-16 v1
摘要
语音大型语言模型(Speech Large Language Models, SLLMs)使情感推理达到高层次,但常常产生无依据、文本偏向的判断,而无法获得可验证的声学证据。相比之下,自监督语音编码器如WavLM提供强大的声学表征,却是难以解释的判别模型,受限于可解释性。为弥合这一差距,本文引入ADEPT(Agentic Decoding of Emotion via Evidence Probing Tools, 通过证据探测工具实现情感的代理解码)框架,将情感识别重新框定为多轮询问过程,而非单次预测。ADEPT将SLLM转化为维护演进情感候选集合的代理,并在结构化的候选生成、证据收集和裁决管道中自适应调用专门的语义和声学探测工具。关键在于,ADEPT实现从共识学习向模糊动力情感推理的范式转变。由于人类情感具有内在复杂性和情感常常共存,本文将少数注释视为有信息的感知信号,而非将其视为噪声。最后,我们将Group Relative Policy Optimization(GRPO)与Evidence Trust Gate集成,显式地将工具使用行为与预测质量耦合,强制实现基于证据的推理。在实验中,ADEPT在大多数设置下提高了主要情感准确率,同时显著改善了次要情感表征,产生以可审计声学和语义证据为依据的解释。
引用
@article{arxiv.2602.12714,
title = {ADEPT: RL-Aligned Agentic Decoding of Emotion via Evidence Probing Tools -- From Consensus Learning to Ambiguity-Driven Emotion Reasoning},
author = {Esther Sun and Bo-Hao Su and Abinay Reddy Naini and Shinji Watanabe and Carlos Busso},
journal= {arXiv preprint arXiv:2602.12714},
year = {2026}
}
备注
Under Review