中文

超越指标:评估LLM在文化细微、低资源真实场景中的有效性

计算与语言 2024-06-14 v2

摘要

大型语言模型在现实应用中的部署既带来机遇也带来挑战,尤其是在多语言和代码混合的通信环境中。本研究评估了七个领先的大型语言模型在情感分析任务上的性能,数据集来源于多语言和代码混合的WhatsApp聊天记录,包括斯瓦希里语、英语和斯瓦希里英语混合语。我们的评估包括使用F1分数等指标的定量分析,以及对其预测解释的定性评估。我们发现,尽管Mistral-7b和Mixtral-8x7b取得了较高的F1分数,但它们以及其他大型语言模型(如GPT-3.5-Turbo、Llama-2-70b和Gemma-7b)在理解语言和语境细微差别方面存在困难,并且从其解释中观察到决策过程缺乏透明度。相比之下,GPT-4和GPT-4-Turbo在理解多样化语言输入和管理各种上下文信息方面表现出色,显示出与人类高度一致的对齐性和决策过程的透明度。然而,这些大型语言模型在融入文化细微差别方面遇到困难,尤其是在非英语环境中,GPT-4系列在这方面表现不一致。研究结果强调了持续改进大型语言模型的必要性,以有效应对文化细微、低资源现实环境中的挑战,并需要开发评估基准来捕捉这些问题。

关键词

引用

@article{arxiv.2406.00343,
  title  = {Beyond Metrics: Evaluating LLMs' Effectiveness in Culturally Nuanced, Low-Resource Real-World Scenarios},
  author = {Millicent Ochieng and Varun Gumma and Sunayana Sitaram and Jindong Wang and Vishrav Chaudhary and Keshet Ronen and Kalika Bali and Jacki O'Neill},
  journal= {arXiv preprint arXiv:2406.00343},
  year   = {2024}
}