大语言模型能否提出好的问题?
计算与语言
2025-06-19 v2 人工智能
摘要
我们评估了由大语言模型(LLM)从上下文生成的问题,比较它们与人类编写的问题在六个维度上的差异:问题类型、问题长度、上下文覆盖范围、可解答性、罕见性以及所需答案长度。我们的研究涵盖两个开源和两个专有的最先进模型。结果显示,LLM生成的问题倾向于要求更长的描述性答案,并在上下文聚焦方面呈现更均匀的分布,与QA任务中常见的positional bias形成鲜明对比。这些发现为理解LLM生成问题的独特特征并为未来工作在问题质量和下游应用方面提供了启示。
引用
@article{arxiv.2501.03491,
title = {Can LLMs Ask Good Questions?},
author = {Yueheng Zhang and Xiaoyuan Liu and Yiyou Sun and Atheer Alharbi and Hend Alzahrani and Tianneng Shi and Basel Alomair and Dawn Song},
journal= {arXiv preprint arXiv:2501.03491},
year = {2025}
}