利用词汇水印保护语言生成 API 的知识产权
密码学与安全
2021-12-07 v1 计算与语言
摘要
如今,由于自然语言生成(NLG)的突破,包括机器翻译、文档摘要、图像描述等,NLG模型已被封装为云API,服务于全球超过五亿用户,每天处理超过一千亿次词生成。因此,NLG API已成为许多商业公司中不可或缺且盈利的服务。由于巨大的资金与智力投入,服务提供商采用按使用付费策略以促进市场可持续增长。然而,近期工作表明,云平台遭受模型提取攻击造成的财务损失,此类攻击旨在模仿受害服务的功能与效用,从而侵犯云API的知识产权(IP)。本工作旨在通过识别利用来自受害NLG API的水印响应的攻击者,来保护NLG API的IP。然而,现有大多数水印技术不能直接适用于NLG API的IP保护。为弥补这一差距,我们首先通过对原始输出进行词汇修改,提出一种用于文本生成API的新型水印方法。与竞争性基线相比,我们的水印方法在p值方面实现了更好的可识别性能,且语义损失更小。此外,与基线相比,我们的水印对人类而言更易懂且更直观。最后,实证研究表明,我们的方法也适用于来自不同领域的查询,并且对基于包含少于10%水印样本的混合语料训练的攻击者同样有效。
引用
@article{arxiv.2112.02701,
title = {Protecting Intellectual Property of Language Generation APIs with Lexical Watermark},
author = {Xuanli He and Qiongkai Xu and Lingjuan Lyu and Fangzhao Wu and Chenguang Wang},
journal= {arXiv preprint arXiv:2112.02701},
year = {2021}
}
备注
accepted to AAAI2022