中文

LLM-AD:基于大型语言模型的音频描述系统

计算机视觉与模式识别 2024-05-03 v1

摘要

音频描述(AD)的发展一直是使视频内容更具可访问性和包容性的关键一步。传统上,AD 制作需要大量熟练劳动力,而现有的自动化方法仍需大量训练来整合多模态输入,并将输出从字幕风格调整为 AD 风格。在本文中,我们介绍了一种自动 AD 生成流程,它利用了 GPT-4V(ision) 强大的多模态和指令遵循能力。值得注意的是,我们的方法采用了现成的组件,无需额外训练。得益于基于追踪的角色识别模块,它生成的 AD 不仅符合既定的自然语言 AD 制作标准,还能在帧之间保持上下文一致的角色信息。在 MAD 数据集上的全面分析表明,我们的方法在自动 AD 制作中取得了与基于学习的方法相当的性能,其 CIDEr 分数达到 20.5 即可证实这一点。

关键词

引用

@article{arxiv.2405.00983,
  title  = {LLM-AD: Large Language Model based Audio Description System},
  author = {Peng Chu and Jiang Wang and Andre Abrantes},
  journal= {arXiv preprint arXiv:2405.00983},
  year   = {2024}
}