中文

DALD:无需黑盒大语言模型logits的改进型基于logits的检测器

计算与语言 2024-10-29 v4 机器学习

摘要

大语言模型(LLM)的出现彻底改变了文本生成,产生的输出与人类写作极为相似。这种机器与人类撰写文本之间界限的模糊给区分两者带来了新的挑战,而领先的专有LLM的频繁更新和封闭性进一步使这一任务复杂化。当黑盒LLM无法提供精确logits时,传统的基于logits的检测方法利用代理模型来识别LLM生成的内容。然而,这些方法难以应对代理模型与通常未公开的目标模型之间的分布不匹配,导致性能下降,尤其是在引入新的闭源模型时。此外,虽然当前方法在源模型已知时通常有效,但在模型版本未知或测试集包含来自多个源模型的输出时,它们会失败。为解决这些局限性,我们提出了分布对齐的LLM检测(DALD),这是一个创新框架,即使在无法获取源LLM的logits的情况下,也能重新定义黑盒文本检测的最先进性能。DALD旨在使代理模型的分布与未知目标LLM的分布对齐,确保增强的检测能力和对快速模型迭代的鲁棒性,且训练投入最小。通过利用来自ChatGPT、GPT-4和Claude-3等先进模型的公开可访问输出的语料样本,DALD有效地微调代理模型以与未知源模型分布同步。

关键词

引用

@article{arxiv.2406.05232,
  title  = {DALD: Improving Logits-based Detector without Logits from Black-box LLMs},
  author = {Cong Zeng and Shengkun Tang and Xianjun Yang and Yuanzhou Chen and Yiyou Sun and zhiqiang xu and Yao Li and Haifeng Chen and Wei Cheng and Dongkuan Xu},
  journal= {arXiv preprint arXiv:2406.05232},
  year   = {2024}
}