中文

信任、安全与准确性:评估 LLM 为常规产妇咨询

计算与语言 2026-03-19 v1 计算机与社会

摘要

可靠产妇健康信息的获取是农村印度地区的一个重大挑战,由于医疗资源和基础设施有限。鉴于拥有超过 83 亿互联网用户且近半数的农村妇女在线,数字工具为健康教育提供了新的机遇。本研究评估了像 ChatGPT-4o、Perplexity AI 和 GeminiAI 等大型语言模型(LLM),以提供可靠且易于理解的妊娠相关信息。针对每个模型提出 17 个针对妊娠的提问,并与产妇健康专业人员的回答进行比较。评估使用语义相似性、名词重叠和可读性指标衡量内容质量。结果表明,Perplexity 在接近专家语义方面表现突出,而 ChatGPT-4o 产生更清晰、更易于理解的文本,医学术语更准确。随着互联网接入的增长,LLM 可作为农村地区产妇健康教育的可扩展辅助工具。该研究突显了在健康沟通中平衡准确性和可理解性的 AI 工具需求,以改善资源不足地区的医疗沟通。

关键词

引用

@article{arxiv.2603.16872,
  title  = {Trust, Safety, and Accuracy: Assessing LLMs for Routine Maternity Advice},
  author = {V Sai Divya and A Bhanusree and Rimjhim and K Venkata Krishna Rao},
  journal= {arXiv preprint arXiv:2603.16872},
  year   = {2026}
}