中文

D-GEN:面向生成模型可靠评估的自动干扰项生成与评估

计算与语言 2025-06-16 v2

摘要

使用开放式生成评估生成模型存在响应格式不一致的挑战。多选(MC)评估有助于缓解此问题,但生成高质量干扰项耗时且代价高昂。我们提出 D-GEN,首个开源干扰项生成模型,将开放式数据转换为 MC 格式。为评估干扰项质量,我们提出了两种新方法:(1)排序对齐,确保生成的干扰项保留真实干扰项的判别能力;(2)熵分析,比较模型置信度分布。我们的结果显示,D-GEN 保留了排序一致性(Spearman's rho=0.99,Kendall's tau=0.94),且与真实干扰项的熵分布高度吻合。人类评估进一步确认了其流畅性、连贯性、诱导性和错误性。我们的工作推动了自动化、可靠的干扰项生成与评估,制定了 MC 评估的新标准。

关键词

引用

@article{arxiv.2504.13439,
  title  = {D-GEN: Automatic Distractor Generation and Evaluation for Reliable Assessment of Generative Model},
  author = {Grace Byun and Jinho D. Choi},
  journal= {arXiv preprint arXiv:2504.13439},
  year   = {2025}
}

备注

ACL 2025 Findings