中文

视频翻译的生成式AI:面向多语言视频会议的可扩展架构

多媒体 2025-12-17 v1 人工智能 计算与语言 计算机视觉与模式识别

摘要

级联生成式 AI 流水线在视频翻译等应用中的实时部署受到显著的系统级挑战的制约。这些挑战包括顺序模型推理的累积延迟以及二次(O(N²))计算复杂度,后者使多用户视频会议应用无法扩展。本文提出并评估了一个旨在缓解这些关键瓶颈的实用系统级框架。所提出的架构包含一种轮流机制,将多用户场景中的计算复杂度从二次降低到线性,以及一种分段处理协议,以管理推理延迟实现感知上的实时体验。我们在多层次硬件设置上实现了一个概念验证流水线并进行了严格的性能分析,包括消费级(NVIDIA RTX 4060)、云端(NVIDIA T4)和企业级(NVIDIA A100)GPU。我们的客观评估表明该系统在现代硬件上实现了实时吞吐量(τ < 1.0)。主观用户研究进一步验证了该方法,表明可预测的初始处理延迟在用户换取流畅、不间断的播放体验时是高度可接受的。该工作呈现了一个经过验证的端到端系统设计,为在多语言通信平台中部署可扩展的实时生成式 AI 应用提供了实用路线图。

关键词

引用

@article{arxiv.2512.13904,
  title  = {Generative AI for Video Translation: A Scalable Architecture for Multilingual Video Conferencing},
  author = {Amirkia Rafiei Oskooei and Eren Caglar and Ibrahim Sahin and Ayse Kayabay and Mehmet S. Aktas},
  journal= {arXiv preprint arXiv:2512.13904},
  year   = {2025}
}

备注

Accepted manuscript. Published in Applied Sciences, 2025