中文

QAQ:用于选择高质量合成代码指令的双向语义一致性

计算与语言 2026-03-17 v2

摘要

合成数据已成为训练代码生成模型的必需品,但引入的噪声和幻觉难以被当前指标检测。现有数据选择方法如 Instruction-Following Difficulty(IFD)通常评估模型在给定查询 (AQA|Q) 的情况下生成答案的难易程度。然而,这一指标在噪声合成数据上含义模糊,低概率难以区分内在任务复杂度与模型生成的幻觉。我们提出 QAQ,一种新型数据选择框架,从相反方向评估数据质量:答案能否预测查询 (QAQ|A)。我们定义 Reverse Mutual Information(RMI)来量化给定答案后对查询信息的增益。我们的分析表明,RMI 的两个极端都指示质量问题:低 RMI 表示语义错位,而过高的 RMI 可能包含 LLM 易识别的缺陷模式。此外,我们引入一种基于强模型与弱模型 disagreement 的选择策略,以识别有效且具挑战性的样本。WarriorCoder 数据集上的实验表明,仅通过分层 RMI 选择 25% 的数据即可实现与全量训练相当的性能,显著优于现有数据选择方法。我们的研究突显了合成数据策展中双向语义一致性的重要性,为在不牺牲模型能力的前提下降低计算成本提供了可扩展路径。

关键词

引用

@article{arxiv.2603.12165,
  title  = {QAQ: Bidirectional Semantic Coherence for Selecting High-Quality Synthetic Code Instructions},
  author = {Jiayin Lei and Ming Ma and Yunxi Duan and Chenxi Li and Tianming Yang},
  journal= {arXiv preprint arXiv:2603.12165},
  year   = {2026}
}

备注

14 pages, 5 figures. Under review at ACL 2026