面向大规模数据集和特征导向的大语言模型文本摘要评估
人机交互
2025-08-13 v3
摘要
近期大语言模型(LLMs)和提示工程的发展使得聊天机器人的定制更加可及,显著降低了此前需要编程技能才能完成的任务的门槛。然而,尤其是在数据集规模上进行提示评估仍然复杂,因为需要在数据集中的数千个测试实例中对提示进行评估。我们的研究基于全面的文献综述和试点研究,总结了提示评估中的五个关键挑战。作为响应,我们引入了一个面向特征的工作流程,用于系统化的提示评估。在文本摘要的上下文中,我们的工作流程主张使用摘要特征(如复杂度、正式性或自然性)进行评估,而不是使用传统的质量指标如 ROUGE。这种设计选择使得提示的评估更加用户友好,因为它引导用户梳理自然语言中固有的模糊性。为支持这一工作流程,我们引入了Awesum——一个可视化分析系统,通过交互式可视化帮助识别文本摘要的最佳提示优化方案, featuring 一种新颖的 Prompt Comparator 设计,该设计采用受气泡集(BubbleSet)启发的设计,并通过降维技术增强。我们通过来自 various 领域的实践者进行评估,证明了该系统的有效性和通用性,发现 (1)我们的设计有助于克服非技术人员进行系统化摘要提示评估的学习曲线,(2)我们的特征导向工作流程有望推广到其他 NLG 和图像生成任务。对于未来的工作,我们主张致力于大语言模型提示的特征导向评估,并讨论了人机交互方面的未解决挑战。
引用
@article{arxiv.2407.12192,
title = {Towards Dataset-scale and Feature-oriented Evaluation of Text Summarization in Large Language Model Prompts},
author = {Sam Yu-Te Lee and Aryaman Bahukhandi and Dongyu Liu and Kwan-Liu Ma},
journal= {arXiv preprint arXiv:2407.12192},
year = {2025}
}