DialogueSidon: 从野生对话音频中恢复全双工对话轨迹
声音
2026-04-14 v2 音频与语音处理
摘要
全双工对话音频即每个说话人记录在独立轨道上,是言语对话研究的重要资源,但规模收集困难。大多数野生双说话对话仅以恶化的单声道混合形式提供,难以满足需要干净说话人信号的系统。我们提出 DialogueSidon,一种用于恢复和分离恶化单声道双说话对话音频的模型。DialogueSidon 将变分自编码器 (VAE) 作用于语音自监督学习 (SSL) 模型特征,对 SSL 模型特征进行压缩到紧凑的潜空间,同时结合基于扩散的潜表示预测器,从恶化混合信号中恢复说话人级潜表示。在英语、多语言以及野生对话数据集上实验表明,DialogueSidon 在可懂性和分离质量方面显著优于基线方法,同时实现了 much 更快的推理速度。
引用
@article{arxiv.2604.09344,
title = {DialogueSidon: Recovering Full-Duplex Dialogue Tracks from In-the-Wild Dialogue Audio},
author = {Wataru Nakata and Yuki Saito and Kazuki Yamauchi and Emiru Tsunoo and Hiroshi Saruwatari},
journal= {arXiv preprint arXiv:2604.09344},
year = {2026}
}
备注
12 pages, 2 figures, fixed invalid link