中文

请稍等:面向多语言语音纠错的无决策感感知目标调优

计算与语言 2026-05-13 v1 人工智能

摘要

自动语音识别(ASR)转录文本常包含填充词、重复词和错误开头等无决策感成分,这些成分降低了可读性,妨碍了聊天机器人和语音助手等下游应用的可靠性。如果未加处理,这类无决策感会显著降低下游系统的可靠性。大多数现有方法依赖经典模型,专注于识别无决策感标记进行删除。尽管此策略在某种程度上有效,但会破坏语法结构和语义连贯性,导致不完整或不自然的句子。近期文献探索了使用大语言模型(LLM),但这些努力主要集中在无决策感检测或数据增强,而非进行综合纠错。我们提出了一个多语言纠错管道,其中序列标注器首先标记无决策感标记,这些信号指导对 LLM 进行指令微调,以将转录文本重写为流畅文本。为进一步提高可靠性,我们添加了对抗学习目标,以惩罚无决策感标记的重现,鼓励模型在删除无决策感痕迹的同时保持语法和语义。我们在印度三种语言(印地语、孟加拉语和马拉拉语)上的实验显示,与强大的基线(包括多语言序列到序列模型)相比,方法持续取得改进。这些结果表明,仅靠检测策略不足以解决问题。将标记级线索与指令调优和对抗学习结合,为语音驱动 NLP 系统中的多语言无决策感纠错提供了实用且可扩展的解决方案。我们将代码公开于 https://github.com/deepak-kumar-98/Mind-the-Pause。

关键词

引用

@article{arxiv.2605.12242,
  title  = {Mind the Pause: Disfluency-Aware Objective Tuning for Multilingual Speech Correction with LLMs},
  author = {Deepak Kumar and Baban Gain and Asif Ekbal},
  journal= {arXiv preprint arXiv:2605.12242},
  year   = {2026}
}

备注

Accepted to ACL 2026 (Main)