从答题到出题:检视 LLM 在常识推理评估题中的 authoring 能力
计算与语言
2024-10-22 v1 人工智能
摘要
LLM 现在能够执行各种复杂的写作任务,并且在解答关于自然语言推理和常识推理的问题方面表现出色。编写这些问题本身就是一项技艺般的写作任务,因此本文将 LLM 视为常识推理评估题的作者。我们让 LLM 以著名常识推理基准测试 Choice of Plausible Alternatives (COPA) 的风格生成题目,并根据由 LLM 和人工标注所促进的分析进行检视。我们发现,成功于原始 COPA 基准测试的 LLM 在 authoring 自己的题目方面也更成功。
关键词
引用
@article{arxiv.2410.14897,
title = {From Test-Taking to Test-Making: Examining LLM Authoring of Commonsense Assessment Items},
author = {Melissa Roemmele and Andrew S. Gordon},
journal= {arXiv preprint arXiv:2410.14897},
year = {2024}
}
备注
Accepted at Findings of EMNLP 2024