大型语言模型生成 Telugu 母婴健康查询响应的比较分析
信息检索
2026-03-20 v1
摘要
大型语言模型(LLM)正在逐步在各类研究领域展现其能力。针对低资源语言(如 Telugu、Hindi、Tamil、Urdu 等)在急性母婴健康领域的表现,仍缺乏系统研究。本研究评估了 ChatGPT-4o、GeminiAI 和 Perplexity AI 对不同语言提出的孕期相关问题所作出的响应。采用双语数据集,通过 BERT Score 等语义相似度指标和产科专家的评估来获取结果。产科专家综合考虑准确性、流畅性、相关性、连贯性和完整性等多个参数,对生成的 LLM 响应进行评级。实验结果表明,Gemini 在其他 LLM 中以更高的准确性和连贯性在 Telugu 语言中生成与孕期相关的响应方面表现突出,而 Perplexity 在提示为 Telugu 时表现良好。ChatGPT 的表现可进一步提升。结果表明,选择哪个 LLM 以及使用的提示语言都是检索信息质量的关键因素。总体而言,我们强调需改进 LLM 在区域语言中为医疗目的提供帮助的能力。
引用
@article{arxiv.2603.18898,
title = {Comparative Analysis of Large Language Models in Generating Telugu Responses for Maternal Health Queries},
author = {Anagani Bhanusree and Sai Divya Vissamsetty and K VenkataKrishna Rao and Rimjhim},
journal= {arXiv preprint arXiv:2603.18898},
year = {2026}
}