中文

TRAVID:一种端到端视频翻译框架

计算与语言 2023-09-21 v1 人工智能

摘要

在当今全球化世界中,与来自不同语言背景的人进行有效沟通已变得愈发关键。虽然传统的语言翻译方法(如书面文本或仅语音翻译)能够完成任务,但它们往往无法捕捉通过面部表情和唇部运动等非语言线索所传达的完整语境和细微信息。在本文中,我们提出了一种端到端视频翻译系统,不仅翻译口语,还将翻译后的语音与说话者的唇部运动同步。我们的系统专注于翻译多种印度语言的教育讲座,并且被设计为即使在低资源系统设置下也有效。通过结合与目标语言一致的唇部运动,并使用语音克隆技术将其与说话者声音匹配,我们的应用为学生和用户提供了增强的体验。这一附加特性创造了更具沉浸感和真实感的学习环境,最终使学习过程更加高效和引人入胜。

关键词

引用

@article{arxiv.2309.11338,
  title  = {TRAVID: An End-to-End Video Translation Framework},
  author = {Prottay Kumar Adhikary and Bandaru Sugandhi and Subhojit Ghimire and Santanu Pal and Partha Pakray},
  journal= {arXiv preprint arXiv:2309.11338},
  year   = {2023}
}