中文

对话任务的战略性提示:大型语言模型在多样化对话任务中的比较分析

计算与语言 2024-12-02 v2 人工智能

摘要

鉴于对话人工智能的不断进步,对大型语言模型(LLM)的评估与评估在确保其在各种对话任务中实现最佳性能方面发挥着关键作用。本文提出了一项全面研究,对五种主流大型语言模型(Llama、OPT、Falcon、Alpaca 和 MPT)的能力与局限性进行彻底评估。该研究涵盖了各种对话任务,包括预订、同理心响应生成、心理健康与法律咨询、说服与谈判。为开展评估,采用了广泛的测试设置,运用多种评估标准,从自动评估到人类评估不等,包括使用通用和任务特定的指标来准确衡量各语言模型的性能。通过我们的评估,没有哪一个模型在所有任务中都能表现出普遍最优。相反,各模型的表现会因特定任务的要求而有很大差异。尽管某些模型在某些任务中表现出色,但在其他任务中可能表现较差。这些发现强调,在为对话应用选择最合适的语言模型时,必须考虑任务特定的要求与特征。

关键词

引用

@article{arxiv.2411.17204,
  title  = {Strategic Prompting for Conversational Tasks: A Comparative Analysis of Large Language Models Across Diverse Conversational Tasks},
  author = {Ratnesh Kumar Joshi and Priyanshu Priya and Vishesh Desai and Saurav Dudhate and Siddhant Senapati and Asif Ekbal and Roshni Ramnani and Anutosh Maitra and Shubhashis Sengupta},
  journal= {arXiv preprint arXiv:2411.17204},
  year   = {2024}
}

备注

39 pages, 12 tables