通过 MUTUD 实现高效的音视联合语音处理:多模态训练与单模态部署
高能物理 - 格点
2025-02-19 v2
摘要
构建可靠的语音系统通常需要结合多种模态(如音频和视觉线索)。虽然此类多模态解决方案常能提升性能,甚至在某些情况下至关重要,但其面临感官需求、计算成本及模态同步等多项约束。这些挑战限制了其在实际应用中的直接使用。本文提出一种方法:训练时使用所有可用模态,而推理/部署时仅使用一种或少数几种模态。为实现此目标,我们提出多模态训练与单模态部署(MUTUD)框架,包含时序对齐模态特征估计(TAME)模块,能在推理时估计缺失模态的信息。这种创新方法促进了不同模态间信息的整合,利用各模态优势弥补推理期间特定模态缺失的影响。我们将 MUTUD 应用于多种音视语音任务,证明其可显著缩小多模态模型与单模态模型之间的性能差距。MUTUD 在降低模型规模和计算资源方面也具有优势,部分情况下可降低近 80%。
引用
@article{arxiv.2501.18156,
title = {Discrete symmetry and 't Hooft anomalies for 3450 model},
author = {Tetsuya Onogi and Hiroki Wada and Tatsuya Yamaoka},
journal= {arXiv preprint arXiv:2501.18156},
year = {2025}
}
备注
7 pages, Contribution to the 41st International Symposium on Lattice Field Theory (LATTICE2024), 28 July - 3 August 2024, Liverpool, UK, New references included