中文

ViDove:具备多模态上下文与记忆增强推理的翻译代理系统

人工智能 2025-07-11 v1 计算与语言 音频与语音处理

摘要

基于大语言模型的翻译代理已实现高度类人化的翻译结果,能够更有效地处理更长更复杂的上下文。然而,它们通常仅限于文本输入。本文引入了 ViDove,一个为多模态输入设计的翻译代理系统。灵感来自人类翻译的工作流程,ViDove 利用视觉和上下文背景信息来增强翻译过程。此外,我们集成了多模态记忆系统和长短期记忆模块,后者包含特定领域的知识,使代理能够在实际场景中更准确、更自适应地工作。结果显示,ViDove 在字幕生成和通用翻译任务中实现了显著提升,BLEU 分数提高了 28%,SubER 提高了 15%。此外,我们引入了 DoveBench,这是一个用于长格式自动视频字幕和翻译的新基准,包含 17 小时的高质量、人工标注数据。我们的代码可在 https://github.com/pigeonai-org/ViDove 获取。

关键词

引用

@article{arxiv.2507.07306,
  title  = {ViDove: A Translation Agent System with Multimodal Context and Memory-Augmented Reasoning},
  author = {Yichen Lu and Wei Dai and Jiaen Liu and Ching Wing Kwok and Zongheng Wu and Xudong Xiao and Ao Sun and Sheng Fu and Jianyuan Zhan and Yian Wang and Takatomo Saito and Sicheng Lai},
  journal= {arXiv preprint arXiv:2507.07306},
  year   = {2025}
}