中文

StreamAtt:基于注意力的直接流式语音到文本翻译

声音 2024-06-11 v1 人工智能 计算与语言 音频与语音处理

摘要

流式语音到文本翻译(StreamST)是指在接收音频流的过程中自动翻译语音的任务。不同于同时翻译(SimulST),后者处理预分段语音,StreamST 面临处理连续且不可限定的音频流的挑战。这需要对前导历史的保留作出额外决策,而由于延迟和计算限制,完全保留全部历史是不可行的。尽管对实时翻译的实际需求日益增长,但关于流式翻译的研究仍有限,现有工作仅聚焦于 SimulST。为填补这一空白,我们提出 StreamAtt,即首个 StreamST 策略,并设计 StreamLAAL,即首个针对 StreamST 的延迟指标,旨在与现有 SimulST 指标可比。对 MuST-C v1.0 的全部 8 种语言进行的大量实验表明,StreamAtt 相对于朴素的流式基线和相关的 SOTA SimulST 策略具有有效性,为 StreamST 研究的第一步。

关键词

引用

@article{arxiv.2406.06097,
  title  = {StreamAtt: Direct Streaming Speech-to-Text Translation with Attention-based Audio History Selection},
  author = {Sara Papi and Marco Gaido and Matteo Negri and Luisa Bentivogli},
  journal= {arXiv preprint arXiv:2406.06097},
  year   = {2024}
}

备注

Accepted at ACL 2024 main conference