中文

视频数据飞轮:解决视频语言理解中的不可达数据三角问题

计算机视觉与模式识别 2024-10-01 v1 计算与语言 机器学习 多媒体

摘要

最近,视频语言理解通过大规模预训练取得了很大成功。然而,数据稀缺仍是 persist 挑战。本研究定量揭示了数据数量、多样性和质量在预训练数据集中的不可达三角问题。近期的努力试图通过合成标注来细化那些因质量低下而受限的大规模、多样的 ASR 数据集。这些方法成功地利用视频内容中有用的信息(帧、标签、ASR 转录文本等)来细化原始标注。然而,它们难以缓解合成标注中的噪声,且在数据规模扩大时缺乏可扩展性。为此,我们引入 Video DataFlywheel 框架,通过改进的噪声控制方法实现视频标注的迭代细化。对于迭代细化,我们首先利用视频语言模型生成合成标注, resulting in 一个细化后的数据集。然后,我们在其上进行预训练,并在人类细化示例上进行微调以获得更强的模型。这一过程被重复进行以实现持续改进。对于噪声控制,我们提出了 AdaTaiLr,这是一种需要对噪声分布进行较弱假设的新型噪声控制方法,从而在大型数据集中具有更好的效果并提供理论保证。迭代细化与 AdaTaiLr 的结合可以在视频语言理解中实现更好的可扩展性。广泛的实验表明,我们的框架在现有数据细化基线上实现了超过 3% 的性能提升,并以最小的多样性损失提升了数据集质量。此外,我们的细化后数据集在各种视频语言理解任务上都实现了显著的改进,包括视频问答和文本-视频检索。

关键词

引用

@article{arxiv.2409.19532,
  title  = {Video DataFlywheel: Resolving the Impossible Data Trinity in Video-Language Understanding},
  author = {Xiao Wang and Jianlong Wu and Zijia Lin and Fuzheng Zhang and Di Zhang and Liqiang Nie},
  journal= {arXiv preprint arXiv:2409.19532},
  year   = {2024}
}

备注

Under peer review