HintEval:一个面向问题提示生成与评估的综合框架
计算与语言
2025-02-04 v1 信息检索
摘要
大语言模型(LLMs)正在改变人们查找信息的方式,如今许多用户转向聊天机器人来获取问题的答案。尽管LLMs提供了即时获取丰富信息的途径,但培养批判性思维和解决问题的能力仍然很重要。自动提示生成是一项新任务,旨在通过创建引导用户自行找到答案而不直接揭示答案的提示,来支持人类回答问题。在此背景下,提示评估侧重于衡量提示的质量,有助于改进提示生成方法。然而,目前提示研究的资源分散在不同的格式和数据集中,而评估工具缺失或不兼容,使得研究人员难以比较和测试他们的模型。为了克服这些挑战,我们引入了HintEval,一个Python库,它使访问多样化数据集变得容易,并提供了多种生成和评估提示的方法。HintEval将分散的资源整合到一个单一的工具包中,支持一系列研究目标,并实现清晰、多面且可靠的评估。所提出的库还包括详细的在线文档,帮助用户快速探索其功能并开始使用。通过降低入门门槛并鼓励一致的评估实践,HintEval为促进NLP/IR社区内的提示生成和分析研究迈出了重要一步。
引用
@article{arxiv.2502.00857,
title = {HintEval: A Comprehensive Framework for Hint Generation and Evaluation for Questions},
author = {Jamshid Mozafari and Bhawna Piryani and Abdelrahman Abdallah and Adam Jatowt},
journal= {arXiv preprint arXiv:2502.00857},
year = {2025}
}
备注
Submitted to SIGIR 2025