DAME:用于时长鲁棒说话人验证的时长感知套娃嵌入
音频与语音处理
2026-01-21 v1 人工智能
摘要
短语音说话人验证由于短语音片段中有限的说话人区分性线索而仍然具有挑战性。虽然现有方法侧重于增强说话人编码器,但嵌入学习策略仍然强制使用单一固定维度的表示,并重用于任意长度的语音,导致容量与不同时长下可用的信息不匹配。我们提出了时长感知套娃嵌入(DAME),这是一个与模型无关的框架,它构建了一个与语音时长对齐的嵌套子嵌入层次结构:低维表示从短语音中捕获紧凑的说话人特征,而高维则编码来自较长语音的更丰富细节。DAME支持从头开始训练和微调,并可作为传统大间隔微调的直接替代方案,持续提升不同时长下的性能。在VoxCeleb1-O/E/H和VOiCES评估集上,DAME持续降低了1秒和其他短时长测试的等错误率,同时保持了全时长性能,且没有额外的推理成本。这些增益在通用训练和微调设置下,可泛化到各种说话人编码器架构。
引用
@article{arxiv.2601.13999,
title = {DAME: Duration-Aware Matryoshka Embedding for Duration-Robust Speaker Verification},
author = {Youngmoon Jung and Joon-Young Yang and Ju-ho Kim and Jaeyoung Roh and Chang Woo Han and Hoon-Young Cho},
journal= {arXiv preprint arXiv:2601.13999},
year = {2026}
}
备注
5 pages, 2 figures, Accepted at ICASSP 2026