BanglaLorica:面向 Bangla 文本生成中大语言模型的鲁棒水印算法设计与评估
计算与语言
2026-01-09 v1 人工智能
摘要
随着大型语言模型(LLM)越来越多地被部署用于文本生成,水印技术已成为作者归属、知识产权保护和滥用检测的必要手段。尽管现有的水印方法在高资源语言中表现良好,但它们在低资源语言中的鲁棒性仍未得到充分探索。本工作首次在跨语言往返翻译(RTT)攻击下,对 Bangla LLM 文本生成中最先进的文本水印方法(KGW、指数采样(EXP)和 Waterfall)进行了系统评估。在良性条件下,KGW 和 EXP 实现了高检测准确率(>88%),且困惑度和 ROUGE 的下降可忽略不计。然而,RTT 导致检测准确率崩溃至 9-13%,表明 token 级水印存在根本性失效。为解决此问题,我们提出了一种结合嵌入时和生成后水印的分层水印策略。实验结果表明,分层水印将 RTT 后的检测准确率提高了 25-35%,达到 40-50% 的准确率,相较于单层方法实现了 3 到 4 倍的相对提升,代价是可控的语义退化。我们的发现量化了多语言水印中鲁棒性与质量的权衡,并确立了分层水印作为 Bangla 等低资源语言的一种实用、免训练的解决方案。我们的代码和数据将公开。
关键词
引用
@article{arxiv.2601.04534,
title = {BanglaLorica: Design and Evaluation of a Robust Watermarking Algorithm for Large Language Models in Bangla Text Generation},
author = {Amit Bin Tariqul and A N M Zahid Hossain Milkan and Sahab-Al-Chowdhury and Syed Rifat Raiyan and Hasan Mahmud and Md Kamrul Hasan},
journal= {arXiv preprint arXiv:2601.04534},
year = {2026}
}
备注
Under review, 12 pages, 7 figures, 5 tables