中文

用于训练多样化常识推理模型的合成数据生成

计算与语言 2026-04-21 v2

摘要

对话式智能体需要不仅提供高质量(即具有常识)的响应,还要考虑多个可能的备选情景,以反映其响应的多样性。尽管对训练多样化常识生成器的需求日益增长,但该领域工作的进展显著受限于缺乏大规模高质量多样化常识训练数据集。由于高昂的标注成本,现有的生成式常识推理(GCR)数据集是由少数量名人工标注者创建的,仅覆盖狭窄的一组常识情景。为解决这一训练资源缺口,我们提出了两种方法,创建第一个面向多样化GCR的合成数据集CommonSyn。我们对该合成数据进行微调的模型在不同大小的大型语言模型(LLMs)上,联合提升了生成的多样性和质量,优于基础模型和在人工标注数据集上进行微调的模型。

关键词

引用

@article{arxiv.2603.18361,
  title  = {Synthetic Data Generation for Training Diversified Commonsense Reasoning Models},
  author = {Tianhui Zhang and Bei Peng and Danushka Bollegala},
  journal= {arXiv preprint arXiv:2603.18361},
  year   = {2026}
}

备注

ACL2026 Main