中文

AnyCap 项目:用于可控全模态描述的统一框架、数据集与基准

计算机视觉与模式识别 2025-10-29 v2

摘要

可控描述对于精确的多模态对齐和指令遵循至关重要,但现有模型往往缺乏细粒度控制和可靠的评估协议。为弥合这一差距,我们提出了 AnyCap 项目,这是一个贯穿模型、数据集与评估的综合解决方案。我们引入 AnyCapModel(ACM),这是一种轻量级即插即用框架,通过无需重新训练底层模型的方式,增强了现有基础模型在全模态描述中的可控性。ACM 重用底层模型的原始描述,同时纳入用户指令和模态特征,以生成改进后的描述。为缓解可控多模态描述的数据稀缺问题,我们构建了 AnyCapDataset(ACD),覆盖三种模态、28 种用户指令类型,包含 30 万 条高质量数据条目。我们进一步提出了 AnyCapEval,一个新的基准,提供更可靠的评估指标,通过解耦内容准确性与风格忠实度来实现对可控描述的可靠评估。在 AnyCapEval 上,ACM 在多样化的基础模型上显著提升了描述质量。值得注意的是,ACM-8B 将 GPT-4o 的内容得分提升了 45%,风格得分提升了 12%,并在广泛使用的基准(如 MIA-Bench 和 VidCapBench)上也取得了显著提升。

关键词

引用

@article{arxiv.2507.12841,
  title  = {AnyCap Project: A Unified Framework, Dataset, and Benchmark for Controllable Omni-modal Captioning},
  author = {Yiming Ren and Zhiqiang Lin and Yu Li and Gao Meng and Weiyun Wang and Junjie Wang and Zicheng Lin and Jifeng Dai and Yujiu Yang and Wenhai Wang and Ruihang Chu},
  journal= {arXiv preprint arXiv:2507.12841},
  year   = {2025}
}