我需要帮助!评估LLM请求用户支持的能力:基于文本到SQL生成的案例研究
计算与语言
2024-10-01 v2 人工智能
摘要
本研究探讨了大语言模型主动寻求用户支持的能力。我们提出了评估性能提升与用户负担之间权衡的指标,并调查了在不同信息可用性下,LLM是否能够确定何时请求帮助。我们的实验表明,在没有外部反馈的情况下,许多LLM难以识别其对用户支持的需求。这些发现凸显了外部信号的重要性,并为未来研究改进支持寻求策略提供了见解。源代码:https://github.com/appier-research/i-need-help
引用
@article{arxiv.2407.14767,
title = {I Need Help! Evaluating LLM's Ability to Ask for Users' Support: A Case Study on Text-to-SQL Generation},
author = {Cheng-Kuang Wu and Zhi Rui Tam and Chao-Chung Wu and Chieh-Yen Lin and Hung-yi Lee and Yun-Nung Chen},
journal= {arXiv preprint arXiv:2407.14767},
year = {2024}
}
备注
Accepted by EMNLP 2024 Main Conference