通过非可逆哈希克服语料库分发的版权障碍
计算与语言
2026-04-28 v1
摘要
虽然注释语料库在自然语言处理(NLP)领域至关重要,但包含版权受保护 material 的语料库在研究人员之间难以交换。然而,这些语料库是完整代表 NLP 任务中野生数据多样性所必需的。我们通过一种合法且公开分享版权文学文本注释的方法来解决此问题。语料库创建者以清晰形式分享注释,同时提供源 material 的非可逆哈希版本。语料库使用者必须拥有源 material,并对其自身的 token 应用相同的哈希函数,以便与共享的注释匹配。关键的是,我们的方法对语料库使用者所拥有的版权数据的版本存在合理差异时仍然稳健。作为示例,我们在不同小说版本上进行了对齐实验。我们的结果表明,在用户版本足够接近语料库创建者的版本时,我们的方法能够正确对齐 98.7%至 99.79%的 token。我们公开发布 novelshare,一个我们方法的 Python 实现。
引用
@article{arxiv.2604.23412,
title = {Overcoming Copyright Barriers in Corpus Distribution Through Non-Reversible Hashing},
author = {Arthur Amalvy and Vincent Labatut and Xavier Bost and Hen-Hsen Huang},
journal= {arXiv preprint arXiv:2604.23412},
year = {2026}
}
备注
Accepted to ACL 2026