中文

检测与消除视频到音频生成中的插入幻觉

声音 2025-12-29 v5 机器学习

摘要

视频到音频 (Video-to-Audio, V2A) 生成取得了显著进展,能够自动合成视频的声音。然而,现有评估指标侧重于语义和时间对齐,忽略了一个关键失效模式:模型常常生成与视觉来源毫无对应关系的声学事件,尤其是 speech 和 music。我们称之为插入幻觉 (Insertion Hallucination, IH),其由数据集偏差(如远离屏幕声音的普遍性)驱动且完全被当前指标遗漏。为应对此挑战,我们首先构建系统化的评估框架,使用多个音频事件检测器的多数投票集成。我们还引入两个新指标量化该问题的流行程度和严重程度:IH@vid(具有幻觉的视频比例)和 IH@dur(幻觉持续时间比例)。基于此,我们提出 HALCON 方法消除 IH。HALCON 采用三阶段流程:首先生成初始音频以暴露幻觉段,随后识别并遮蔽相应不可靠的视觉特征,最后利用纠正后的条件重新生成音频。实验在多个主流 V2A 数据集上表明,SOTA 模型面临严重 IH,而我们的 HALCON 方法平均可将幻觉的流行程度和持续时间降低超过 50%,且未降低甚至在某些情况下提升了音频质量和时间同步的常规指标。我们的工作首次正式定义、系统测度并有效消除插入幻觉,为更可靠、更忠实的 V2A 模型铺平了道路。

关键词

引用

@article{arxiv.2510.08078,
  title  = {Detecting and Mitigating Insertion Hallucination in Video-to-Audio Generation},
  author = {Liyang Chen and Hongkai Chen and Yujun Cai and Sifan Li and Qingwen Ye and Yiwei Wang},
  journal= {arXiv preprint arXiv:2510.08078},
  year   = {2025}
}