中文

大型语言模型在孟加拉消费者健康查询摘要中的性能评估

计算与语言 2025-09-16 v1

摘要

孟加拉语(Bangla)消费者健康查询(CHQs)常包含冗余细节, complicating efficient medical responses。本研究探讨了九个先进大型语言模型(LLMs):GPT-3.5-Turbo、GPT-4、Claude-3.5-Sonnet、Llama3-70b-Instruct、Mixtral-8x22b-Instruct、Gemini-1.5-Pro、Qwen2-72b-Instruct、Gemma-2-27b 和 Athene-70B 在总结孟加拉 CHQs 方面的 zero-shot 性能。使用由 2,350 个标注查询-摘要对组成的 BanglaCHQ-Summ 数据集,我们使用 ROUGE 指标对这些 LLMs 进行基准测试,与孟加拉 T5(一个微调的领先模型)进行比较。Mixtral-8x22b-Instruct 在 ROUGE-1 和 ROUGE-L 方面表现最佳,而 Bangla T5 在 ROUGE-2 方面表现突出。结果表明,zero-shot LLMs 能够与微调模型相抗衡,甚至在无任务特定训练的情况下也能实现高质量摘要。这一工作凸显了 LLMs 在解决低资源语言挑战方面的潜力,为医疗查询摘要提供了可扩展的解决方案。

关键词

引用

@article{arxiv.2505.05070,
  title  = {Performance Evaluation of Large Language Models in Bangla Consumer Health Query Summarization},
  author = {Ajwad Abrar and Farzana Tabassum and Sabbir Ahmed},
  journal= {arXiv preprint arXiv:2505.05070},
  year   = {2025}
}