中文

从答题到出题:检视 LLM 在常识推理评估题中的 authoring 能力

计算与语言 2024-10-22 v1 人工智能

摘要

LLM 现在能够执行各种复杂的写作任务,并且在解答关于自然语言推理和常识推理的问题方面表现出色。编写这些问题本身就是一项技艺般的写作任务,因此本文将 LLM 视为常识推理评估题的作者。我们让 LLM 以著名常识推理基准测试 Choice of Plausible Alternatives (COPA) 的风格生成题目,并根据由 LLM 和人工标注所促进的分析进行检视。我们发现,成功于原始 COPA 基准测试的 LLM 在 authoring 自己的题目方面也更成功。

关键词

引用

@article{arxiv.2410.14897,
  title  = {From Test-Taking to Test-Making: Examining LLM Authoring of Commonsense Assessment Items},
  author = {Melissa Roemmele and Andrew S. Gordon},
  journal= {arXiv preprint arXiv:2410.14897},
  year   = {2024}
}

备注

Accepted at Findings of EMNLP 2024