中文

通过自蒸馏突出视频至音频生成中部分可见的电影语言

计算机视觉与模式识别 2025-07-04 v1 人工智能 多媒体

摘要

视频至音频(V2A)生成取得了显著进展,并在影视和视频后期制作中发挥着关键作用。然而,当前方法忽略了电影语言,这是电影制作中艺术表达的关键组成部分。因此,在拟音目标仅部分可见的场景中,其性能会下降。为了应对这一挑战,我们提出了一种简单的自蒸馏方法,将 V2A 模型扩展至电影语言场景。通过模拟电影语言变化,学生模型学习将训练对的视频特征与相同的视听对应关系对齐,使其能够有效捕捉声音与部分视觉信息之间的关联。我们的方法不仅在部分可见条件下的所有评估指标上均取得了显著提升,而且在大规模 V2A 数据集 VGGSound 上也增强了性能。

关键词

引用

@article{arxiv.2507.02271,
  title  = {Spotlighting Partially Visible Cinematic Language for Video-to-Audio Generation via Self-distillation},
  author = {Feizhen Huang and Yu Wu and Yutian Lin and Bo Du},
  journal= {arXiv preprint arXiv:2507.02271},
  year   = {2025}
}

备注

Accepted by IJCAI 2025