中文

ENTP:基于神经符号文本清洗-混合增强低质量SFT数据

计算与语言 2025-10-28 v1

摘要

监督微调(SFT)通过在精心挑选的高质量指令-响应对子集上进行训练来适应预训练的大语言模型(LLM),这些子集通常来自包含许多低质量或噪声样本的更大数据集。然而,现有的质量优先方法往往忽视被丢弃的低质量数据中的有价信号,并依赖不完美的质量过滤器。我们引入ENTP(通过神经符号文本清洗-混合增强低质量SFT数据),该框架通过符号净化和神经重构来振兴低质量语料库。符号模块基于统计先验条件识别并修剪噪声样本,而神经组件通过利用潜在表示和模型知识合成丰富的指令-响应对。这种神经符号协同作用增强了数据的信息性和多样性。实验表明,ENTP增强的数据集(仅由低质量数据构建)在五个指令跟随基准测试中超过13个 established 数据选择基准,而且甚至超过在原始完整数据集(约30万示例)上的微调。我们的结果凸显了低质量数据潜在的未被充分挖掘,并强调了对智能净化和合成在高效指令对齐中的重要性。

关键词

引用

@article{arxiv.2510.23160,
  title  = {ENTP: Enhancing Low-Quality SFT Data via Neural-Symbolic Text Purge-Mix},
  author = {Zile Yang and Ling Li and Na Di and Jinlong Pang and Yao Zhou and Hao Cheng and Bo Han and Jiaheng Wei},
  journal= {arXiv preprint arXiv:2510.23160},
  year   = {2025}
}