从独立到互动:基于说话人感知的多说话人对话式时序模拟
声音
2026-05-25 v1 音频与语音处理
摘要
我们提出了一种基于说话人感知的方法,用于模拟多说话人对话,捕捉到时间上的一致性和真实的轮次动态。以往的工作通常在说话人和轮次之间假设独立性的基础上建模对话统计。相比之下,我们的方法使用说话人特定的偏差分布来确保说话人内部的时间一致性,同时使用马尔可夫链来控制轮次进行,固定的房间脉冲响应保持空间的真实性。我们还将暂停和重叠统一建模为单个间隙分布,并使用核密度估计实现平滑连续性。针对 Switchboard 数据集进行评估,使用内在指标——全局间隙统计、连续间隙之间的相关性、copula 基于的高阶依赖、轮次熵以及间隙存活函数——显示出基于说话人的模拟在捕捉真实对话模式方面优于基线方法,能够捕捉到细粒度的时间依赖性和真实的说话人交替,同时揭示了在建模长程对话结构方面的开放挑战。
引用
@article{arxiv.2509.15808,
title = {From Independence to Interaction: Speaker-Aware Simulation of Multi-Speaker Conversational Timing},
author = {Máté Gedeon and Péter Mihajlik},
journal= {arXiv preprint arXiv:2509.15808},
year = {2026}
}
备注
Submitted to ICASSP 2026