超越成对比较:知识产权法中机器生成作品显著性的一种分布检验
计算机与社会
2026-01-27 v1 人工智能
摘要
包括新颖性(专利)、独创性(版权)和显著性(商标)在内的关键原则,均取决于一个共同的实证问题:某一作品群体是否与相关的参考类别具有实质性区别。然而,分析通常使用项目层级的证据来操作化这一集合层级的探究:即样本之间的成对比较。对于人类创作作品的有限语料库而言,这种分析单元的不匹配或许尚可应对,因为可以通过临时的聚合来弥合。但对于机器生成的作品,这一问题变得尖锐,因为评估的对象不再是固定的作品集合,而是一个具有有效无界输出空间的生成过程。我们提出了一种分布替代方案:一种基于在语义嵌入上计算的最大均值差异的两样本检验,以确定两个创作过程——无论是人类还是机器——是否产生统计上可区分的输出分布。该检验无需针对特定任务进行训练——从而免除了为了表征生成过程而去发现专有训练数据的需求——并且具有样本高效性,通常仅需 5-10 张图像和 7-20 篇文本即可检测出差异。我们在三个领域验证了该框架:手写数字(受控图像)、专利摘要(文本)和 AI 生成艺术(真实世界图像)。我们揭示了一个感知悖论:即使人类评估者仅以约 58% 的准确率区分 AI 输出与人类创作的艺术,我们的方法仍能检测到分布显著性。我们的结果提供了与“生成模型仅充当训练数据复读机”这一观点相反的证据。它们产生的输出并非如简单复读所预测的那样在统计上与人类基线无法区分,而是在语义上类人但在随机性上有别,这表明其主要功能是在已学习的潜空间中充当语义插值器。
引用
@article{arxiv.2601.18156,
title = {Beyond Pairwise Comparisons: A Distributional Test of Distinctiveness for Machine-Generated Works in Intellectual Property Law},
author = {Anirban Mukherjee and Hannah Hanwen Chang},
journal= {arXiv preprint arXiv:2601.18156},
year = {2026}
}