中文

面向自动音频字幕的语义感知置信度校准

声音 2025-12-12 v1 机器学习

摘要

自动音频字幕模型经常会产生与语义准确性无关的高置信度预测,这限制了其在部署中的可靠性。这一不足源于两个因素:基于n-gram重叠的评估指标未能捕捉语义正确性,以及缺乏校准的置信度估计。我们提出了一个框架,通过整合置信度预测到音频字幕中,并通过语义相似性重新定义正确性来解决这两个限制。我们的方案在Whisper基础的音频字幕模型上增添了一个学习型置信度预测头,从解码器隐藏状态中估计不确定性。我们采用CLAP音频-文本嵌入和句子转换器相似性(FENSE)来定义语义正确性,从而实现反映真实字幕质量而非表面级文本重叠的Expected Calibration Error(ECE)计算。在Clotho v2数据集上的实验表明,置信度引导的beam search结合语义评估在校准性(基于CLAP的ECE为0.071)上显著优于贪婪解码基线(ECE为0.488),同时在标准指标上也提升了字幕质量。我们的结果表明,语义相似性为音频字幕置信度校准提供了比传统n-gram指标更有意义的基础。

关键词

引用

@article{arxiv.2512.10170,
  title  = {Semantic-Aware Confidence Calibration for Automated Audio Captioning},
  author = {Lucas Dunker and Sai Akshay Menta and Snigdha Mohana Addepalli and Venkata Krishna Rayalu Garapati},
  journal= {arXiv preprint arXiv:2512.10170},
  year   = {2025}
}

备注

5 pages, 2 figures