瑞士ADT:瑞士语言的音频描述翻译系统
计算与语言
2024-11-25 v1 人工智能
计算机视觉与模式识别
人机交互
摘要
音频描述 (AD) 是为盲人和视力受损者提供的关键无障碍服务, 旨在以声学形式传递视觉信息。尽管近期多语言机器翻译研究取得进展, 但缺乏精心构建且同步的时间AD数据, 使开发针对瑞士等多语言国家需求的音频描述翻译 (ADT) 系统受阻。此外, 由于大多数ADT系统仅依赖文本,存在将相应视频中的视觉信息纳入以提升ADT输出质量的潜在疑虑。本文提出了SwissADT, 首个为瑞士四种主要语言及英语实现的ADT系统。通过收集以德语、法语、意大利语和英语为基础的增强视频数据的精心构建AD数据, 并利用大型语言模型 (LLM) 的强大功能, 以自动方式将AD脚本翻译为所需的瑞士语言, 以提升多语言受众的信息可及性。我们的广泛实验ADT结果, 包括自动与人类评估, 表明SwissADT在ADT任务上表现有前景。我们认为, 将人类专业知识与LLM的生成能力相结合, 可进一步提升ADT系统性能, 从而惠及更广泛的多语言目标受众。
引用
@article{arxiv.2411.14967,
title = {SwissADT: An Audio Description Translation System for Swiss Languages},
author = {Lukas Fischer and Yingqiang Gao and Alexa Lintner and Sarah Ebling},
journal= {arXiv preprint arXiv:2411.14967},
year = {2024}
}