超越英语:揭示LLM版权合规中的多语言偏见
计算机与社会
2025-03-11 v1 计算与语言
摘要
大型语言模型(LLMs)引发了关于版权保护内容公平使用的重大担忧。尽管先前的研究已经考察了LLM再现受版权保护材料的程度,但它们主要关注英语,忽视了版权保护的多语言维度。在这项工作中,我们通过解决两个关键问题来调查LLM版权保护中的多语言偏见:(1) LLM在跨语言保护版权作品方面是否表现出偏见?(2) 使用特定语言的提示是否更容易引出受版权保护的内容?为了探讨这些问题,我们构建了一个包含英语、法语、中文和韩语流行歌曲歌词的数据集,并使用这些语言的提示系统地探测了七个LLM。我们的发现揭示了LLM在处理版权内容方面存在显著的不平衡,无论是在版权材料的语言方面还是在提示的语言方面。这些结果强调需要进一步研究和开发更稳健的、与语言无关的版权保护机制,以确保跨语言的公平和一致保护。
引用
@article{arxiv.2503.05713,
title = {Beyond English: Unveiling Multilingual Bias in LLM Copyright Compliance},
author = {Yupeng Chen and Xiaoyu Zhang and Yixian Huang and Qian Xie},
journal= {arXiv preprint arXiv:2503.05713},
year = {2025}
}
备注
Work in progress