中文

弥合版权鸿沟:大型视觉语言模型能否识别并尊重受版权保护的内容?

计算与语言 2025-12-29 v1 人工智能 密码学与安全 计算机与社会

摘要

大型视觉语言模型(LVLMs)在多模态推理任务中取得了显著进展。然而,其广泛的可用性引发了对潜在版权侵权的严重担忧。当在上下文中遇到受版权保护的内容(即用户输入、检索到的文档)时,LVLMs能否准确识别并遵守版权法规?未能遵守版权法规可能导致严重的法律和伦理后果,特别是当 LVLMs 基于受版权保护的材料(例如检索到的书籍摘录、新闻报道)生成回复时。在本文中,我们对各种 LVLMs 进行了全面评估,考察它们在处理作为视觉输入呈现的受版权保护的内容(如书籍摘录、新闻文章、音乐歌词和代码文档)时的行为。为了系统地衡量版权合规性,我们引入了一个大规模基准数据集,包含 50,000 个多模态查询-内容对,旨在评估 LVLMs 处理可能导致版权侵权的查询的有效性。鉴于现实世界中的受版权保护的内容可能包含也可能不包含版权声明,该数据集包含了两种不同场景下的查询-内容对:有版权声明和无版权声明。对于前者,我们广泛涵盖了四种类型的版权声明以应对不同情况。我们的评估表明,即使是最先进的闭源 LVLMs 在识别和尊重受版权保护的内容方面也表现出显著缺陷,即使在呈现版权声明时也是如此。为了解决这一局限性,我们引入了一种用于版权合规的新型工具增强防御框架,该框架在所有场景中都降低了侵权风险。我们的研究结果强调了开发具备版权意识的 LVLMs 以确保负责任且合法地使用受版权保护内容的重要性。

关键词

引用

@article{arxiv.2512.21871,
  title  = {Bridging the Copyright Gap: Do Large Vision-Language Models Recognize and Respect Copyrighted Content?},
  author = {Naen Xu and Jinghuai Zhang and Changjiang Li and Hengyu An and Chunyi Zhou and Jun Wang and Boyu Xu and Yuyuan Li and Tianyu Du and Shouling Ji},
  journal= {arXiv preprint arXiv:2512.21871},
  year   = {2025}
}

备注

AAAI 2026 (Oral)