中文

TiCo:可控时长的口语对话模型

计算与语言 2026-05-14 v2 人工智能 音频与语音处理

摘要

我们提出TiCo,一种可控时长的口语对话模型 (SDM),能够遵循时限指令(例如“请生成约15秒的响应”),并生成可控制时长的口语响应。这种能力对于现实中的口语语言系统(如语音助理和交互式智能体)至关重要,因控制响应时长可提升交互质量。然而,尽管现有模型在生成自然口语响应方面表现强劲,但缺乏时钟意识,难以遵循时长相关指令。为系统评估这一问题,我们引入TiCo-Bench,即用于SDM时长指令遵循的首个基准测试,现有的开源和商业模型经常未能满足明确的时长约束。TiCo通过可控时长的口语对话模型实现时长控制,利用口语时间标记 (STM)(例如<10.6秒>)在生成期间估计已过去的时间,这些标记帮助模型保持时钟意识并调整剩余内容以满足目标时长。TiCo通过自生成和强化学习进行后训练,无需问答配对数据。实验结果表明,TiCo在时长误差上相较于其基础模型降低了2.7倍,相较于最强的基线方法降低了1.6倍,同时保持了响应质量。

关键词

引用

@article{arxiv.2603.22267,
  title  = {TiCo: Time-Controllable Spoken Dialogue Model},
  author = {Kai-Wei Chang and Wei-Chih Chen and En-Pei Hu and Hung-yi Lee and James Glass},
  journal= {arXiv preprint arXiv:2603.22267},
  year   = {2026}
}