Antislop:识别和消除语言模型中重复模式的综合框架
机器学习
2025-10-23 v2 计算与语言
摘要
LLM的广泛采用引入了特征性的重复措辞,称为“slop”,这会降低输出质量并使AI生成的文本立即被识别。我们提出Antislop,一个提供检测和消除这些过度使用模式工具的综合框架。我们的方法结合了三个创新:(1)Antislop采样器,它使用回溯在推理时抑制不需要的字符串而不破坏词汇表;(2)一个自动化流水线,用于分析模型特定的slop与人类基线并生成训练数据;(3)最终令牌偏好优化(FTPO),一种新颖的微调方法,对单个令牌进行操作,在推理轨迹中出现禁止模式的任何地方精确调整logits。我们证明,某些slop模式在LLM输出中的出现频率比人类文本高1000倍以上。Antislop采样器成功抑制了8000多种模式,同时保持了质量,而令牌禁止在仅2000个模式时就变得不可用。最重要的是,FTPO实现了90%的slop减少,同时在跨领域评估(包括GSM8K、MMLU和创意写作任务)中保持或提高了性能。相比之下,DPO尽管实现了较弱的抑制,但在写作质量和词汇多样性方面遭受了显著下降。我们在MIT许可下发布所有代码和结果:https://github.com/sam-paech/auto-antislop。
引用
@article{arxiv.2510.15061,
title = {Antislop: A Comprehensive Framework for Identifying and Eliminating Repetitive Patterns in Language Models},
author = {Samuel Paech and Allen Roush and Judah Goldfeder and Ravid Shwartz-Ziv},
journal= {arXiv preprint arXiv:2510.15061},
year = {2025}
}
备注
11 pages + appendices, 16 figures