中文

DSPy Teleprompter 算法的比较研究:将大型语言模型评估指标对齐至人类评估

计算与语言 2024-12-23 v1 人工智能 机器学习 统计金融 统计方法学

摘要

我们认为,声明性自我改进 Python (DSPy) 优化器是一种将大型语言模型 (LLM) 提示及其评估对齐至人类注释方法。我们在 DSPy 框架下对五种 teleprompter 算法进行比较分析,包括 Cooperative Prompt Optimization (COPRO)、Multi-Stage Instruction Prompt Optimization (MIPRO)、BootstrapFewShot、BootstrapFewShot with Optuna 和 K-Nearest Neighbor Few Shot,根据其对人类评估的对齐能力。作为具体例子,我们聚焦于优化用于对齐幻觉检测(使用 LLM 作为评判)至公开可用的基准数据集的人类标注 ground truth标签的提示。我们的实验表明,优化后的提示能够超越各种基准方法检测幻觉,且在这些实验中,某些 telemprompters 优于其他方法。

关键词

引用

@article{arxiv.2412.15298,
  title  = {A Comparative Study of DSPy Teleprompter Algorithms for Aligning Large Language Models Evaluation Metrics to Human Evaluation},
  author = {Bhaskarjit Sarmah and Kriti Dutta and Anna Grigoryan and Sachin Tiwari and Stefano Pasquali and Dhagash Mehta},
  journal= {arXiv preprint arXiv:2412.15298},
  year   = {2024}
}

备注

7 pages, 10 tables, two-column format