DITTO:面向ASR口音自适应的数据高效且公平的定向子集选择
音频与语音处理
2024-12-18 v4 声音
摘要
最先进的自动语音识别(ASR)系统已知在不同语音口音上表现出差异化的性能。为提升在特定目标口音上的表现,一种常用方案是使用口音特定的标注语音微调ASR模型。然而,获取大量特定目标口音的标注语音颇具挑战。选取最能代表目标口音、信息量丰富的语音样本子集,对于有效的ASR微调至关重要。为解决该问题,我们提出DITTO(Data-efficient and faIr Targeted subseT selectiOn,数据高效且公平的定向子集选择),其使用子模互信息(SMI)函数作为采集函数,在固定预算内寻找最匹配目标口音的信息量最大语句集。DITTO的一个重要特性是支持多口音的公平定向,即当ASR模型需在多种口音上均表现良好时,它能自动从多个口音中选取代表性数据点。我们表明,在IndicTTS与L2数据集上,DITTO的标注效率是其他语音选择方法的3-5倍。
引用
@article{arxiv.2110.04908,
title = {DITTO: Data-efficient and Fair Targeted Subset Selection for ASR Accent Adaptation},
author = {Suraj Kothawade and Anmol Mekala and Chandra Sekhara D and Mayank Kothyari and Rishabh Iyer and Ganesh Ramakrishnan and Preethi Jyothi},
journal= {arXiv preprint arXiv:2110.04908},
year = {2024}
}
备注
ACL 2023