基于校准不确定性自适应预测集合的覆盖保证语音情感识别
声音
2025-05-08 v4 机器学习
音频与语音处理
摘要
暴怒行为往往由情感抑制和突发爆发引发,对道路安全构成严重威胁,可能导致碰撞和激进行为。语音情感识别技术可以通过识别负面情感并及时发布警报来缓解这一风险。然而,当前的SER方法(如基于隐马尔可夫模型和长短期记忆网络的方法)主要处理一维信号,容易过拟合且缺乏校准,限制了其在安全关键领域的有效性。我们提出了一种提供统计学严格保证的风险控制预测框架。该方法利用校准集定义二元损失函数,以指示真实标签是否包含在预测集合中。通过数据驱动的阈值β优化联合损失函数,以确保预期测试损失受用户指定的风险水平α的限制。在六个基线模型和两个基准数据集上的评估表明,本框架始终实现至少1-α的最小覆盖率,有效控制了即使在不同的校准-测试分割比例(例如0.1)下保持的边际错误率。通过对小批量在线校准的扩展,在局部交换性假设下进一步验证了框架的鲁棒性和可推广性。我们构建了一个非负测试鞅,以即使在动态和非交换性环境中也能维持预测有效性。跨数据集测试确认了本方法在现实、动态数据情景下维持可靠统计保证的能力。
引用
@article{arxiv.2503.22712,
title = {Coverage-Guaranteed Speech Emotion Recognition via Calibrated Uncertainty-Adaptive Prediction Sets},
author = {Zijun Jia and Jinsong Yu and Hongyu Long and Diyin Tang},
journal= {arXiv preprint arXiv:2503.22712},
year = {2025}
}