中文

基于语气单位的人工智能语种转换:CoVoSwitch

计算与语言 2024-07-22 v1 人工智能 音频与语音处理

摘要

多语言代码切换研究常受数据稀缺和语言偏置限制的制约。为扩充语言表征,我们通过替换通过 PSST 检测到的语气单位来合成代码切换数据,PSST 是从 OpenAI 的 Whisper 微调的语音分割模型,使用语音到文本翻译数据集 CoVoST 2。我们的数据集 CoVoSwitch 涵盖 13 种语言,评估了两种多语言翻译模型 M2M-100 418M 和 NLLB-200 600M 的代码切换翻译性能。我们发现,包含代码切换单元的翻译性能高于单一语言设置,模型在翻译成英文方面比翻译成非英文更擅长代码切换。低资源语言在翻译成英文时从代码切换单元中受益最大,但翻译成非英文时收益较小。翻译成低资源语言的翻译也表现不佳,甚至差于原始代码切换输入。我们发现系统在复制英文标记方面表现突出,但在处理非英文标记方面存在困难;单一语言设置中的偏离问题在代码切换设置中同样适用;模型在代码切换翻译中会因引入原文中不存在的单词而出现幻觉。CoVoSwitch 和代码已在 https://github.com/sophiayk20/covoswitch 上提供。

关键词

引用

@article{arxiv.2407.14295,
  title  = {CoVoSwitch: Machine Translation of Synthetic Code-Switched Text Based on Intonation Units},
  author = {Yeeun Kang},
  journal= {arXiv preprint arXiv:2407.14295},
  year   = {2024}
}

备注

Accepted to ACL 2024 Student Research Workshop (ACL-SRW 2024)