中文

基于稀疏自编码器的人工文本检测特征级洞察

计算与语言 2025-03-17 v1 信息论 math.IT

摘要

随着先进大语言模型(LLM)的兴起,人工文本检测(ATD)正变得越来越重要。尽管已有大量努力,但没有单一算法能在不同类型的未见文本上始终表现良好,也无法保证对新LLM的有效泛化。可解释性在实现这一目标中发挥着关键作用。在本研究中,我们通过使用稀疏自编码器(SAE)从Gemma-2-2b残差流中提取特征来增强ATD的可解释性。我们识别了可解释且高效的特征,通过领域和模型特定统计、导向方法以及人工或LLM-based解读来分析其语义和相关性。我们的方法提供了关于来自各种模型的文本如何与人工撰写内容不同的宝贵洞察。我们表明现代LLM具有独特的写作风格,尤其是在信息密集领域,即使它们可以通过个性化提示生成类人输出。

关键词

引用

@article{arxiv.2503.03601,
  title  = {Feature-Level Insights into Artificial Text Detection with Sparse Autoencoders},
  author = {Kristian Kuznetsov and Laida Kushnareva and Polina Druzhinina and Anton Razzhigaev and Anastasia Voznyuk and Irina Piontkovskaya and Evgeny Burnaev and Serguei Barannikov},
  journal= {arXiv preprint arXiv:2503.03601},
  year   = {2025}
}