DSPy Teleprompter 算法的比较研究:将大型语言模型评估指标对齐至人类评估
计算与语言
2024-12-23 v1 人工智能
机器学习
统计金融
统计方法学
摘要
我们认为,声明性自我改进 Python (DSPy) 优化器是一种将大型语言模型 (LLM) 提示及其评估对齐至人类注释方法。我们在 DSPy 框架下对五种 teleprompter 算法进行比较分析,包括 Cooperative Prompt Optimization (COPRO)、Multi-Stage Instruction Prompt Optimization (MIPRO)、BootstrapFewShot、BootstrapFewShot with Optuna 和 K-Nearest Neighbor Few Shot,根据其对人类评估的对齐能力。作为具体例子,我们聚焦于优化用于对齐幻觉检测(使用 LLM 作为评判)至公开可用的基准数据集的人类标注 ground truth标签的提示。我们的实验表明,优化后的提示能够超越各种基准方法检测幻觉,且在这些实验中,某些 telemprompters 优于其他方法。
关键词
引用
@article{arxiv.2412.15298,
title = {A Comparative Study of DSPy Teleprompter Algorithms for Aligning Large Language Models Evaluation Metrics to Human Evaluation},
author = {Bhaskarjit Sarmah and Kriti Dutta and Anna Grigoryan and Sachin Tiwari and Stefano Pasquali and Dhagash Mehta},
journal= {arXiv preprint arXiv:2412.15298},
year = {2024}
}
备注
7 pages, 10 tables, two-column format