中文

TalkLess:融合抽取式与抽象式语音摘要以保留内容与风格的语音编辑系统

人机交互 2025-08-12 v2

摘要

数以百万计的人士收听播客、音频故事和讲座,但语音编辑仍然繁琐且耗时。创作者会删除不必要的词语,剪裁偏离主题的讨论,甚至重新录制语音以使录音简洁且更具吸引力。以往的工作通过删除完整句子(抽取)来自动摘要语音,但刚性的抽取方式限制了表达的灵活性。AI工具通过摘要后重合成语音(抽象)来实现自动化,但抽象会剥离说话者的风格。我们提出的TalkLess系统灵活地结合抽取与抽象,将语音浓缩同时保留其内容与风格。TalkLess首先生成可能的 transcript 编辑选项,选择以最大化压缩率、覆盖范围和音频质量为目标的编辑方案,然后利用语音编辑模型将 transcript 编辑转化为音频编辑。TalkLess的界面为创作者提供了对自动化编辑的控制方式,通过压缩窗格控制底层措辞编辑,通过大纲窗格控制主要内容编辑。TalkLess在覆盖率和删除语音错误方面优于最新抽取方法。针对12名受试者的对比研究显示,TalkLess显著降低了语音编辑的认知负荷和编辑工作量。我们进一步通过3名创作者的探索性研究展示了TalkLess处理自己语音的潜力。

关键词

引用

@article{arxiv.2507.15202,
  title  = {TalkLess: Blending Extractive and Abstractive Speech Summarization for Editing Speech to Preserve Content and Style},
  author = {Karim Benharrak and Puyuan Peng and Amy Pavel},
  journal= {arXiv preprint arXiv:2507.15202},
  year   = {2025}
}

备注

Accepted to The 38th Annual ACM Symposium on User Interface Software and Technology (UIST '25), September 28-October 1, 2025, Busan, Republic of Korea. 19 pages