解释视素在视听语音识别中的作用
音频与语音处理
2026-05-06 v1
摘要
视听语音识别(AVSR)模型在性能上已超越纯音频模型。然而,AVSR系统的可解释性,特别是视觉模态的作用,仍有待深入探索。本文应用多种可解释性技术来考察视素是如何在最先进的AVSR模型AV-HuBERT中被编码的。首先,我们使用t-分布随机邻域嵌入(t-SNE)来可视化学习到的特征,揭示了由视觉线索驱动的自然聚类,而音频的加入进一步细化了这些聚类。然后,我们采用探测方法来展示音频如何帮助细化特征表示,特别是对于视觉上存在歧义或代表性不足的视素。我们的发现揭示了AVSR中各模态之间的相互作用,并可能为利用视觉信息提升AVSR性能指明新策略。
引用
@article{arxiv.2509.16023,
title = {Interpreting the Role of Visemes in Audio-Visual Speech Recognition},
author = {Aristeidis Papadopoulos and Naomi Harte},
journal= {arXiv preprint arXiv:2509.16023},
year = {2026}
}
备注
Accepted into Automatic Speech Recognition and Understanding- ASRU 2025