语境至关重要:兽医领域商业大语言模型工具的对比
计算与语言
2025-10-03 v1 人工智能
摘要
大语言模型(LLMs)在临床环境中被越来越多地使用,但它们在兽医领域的表现仍未被充分探索。我们评估了三种商业化的兽医专用大语言模型摘要工具(产品1[Hachiko]和产品2和产品3),在一个标准化的兽医肿瘤学记录数据集上。使用基于评分标准的LLM作为评判者框架,摘要在五个领域进行评分:事实准确性、完整性、时间顺序、临床相关性和组织性。产品1取得了最高的整体性能,中位平均分为4.61(四分位距:0.73),而产品2为2.55(四分位距:0.78),产品3为2.45(四分位距:0.92)。它在事实准确性和时间顺序方面获得了满分中位分。为了评估评分框架本身的内部一致性,我们在三次独立运行中重复了评估。大语言模型评判者表现出高可重复性,产品1的平均分标准差为0.015,产品2为0.088,产品3为0.034。这些发现凸显了兽医专用商业大语言模型工具的重要性,并表明LLM作为评判者评估是评估兽医临床自然语言处理摘要的可扩展且可重复的方法。
引用
@article{arxiv.2510.01224,
title = {Context Matters: Comparison of commercial large language tools in veterinary medicine},
author = {Tyler J Poore and Christopher J Pinard and Aleena Shabbir and Andrew Lagree and Andre Telfer and Kuan-Chuen Wu},
journal= {arXiv preprint arXiv:2510.01224},
year = {2025}
}
备注
4 Figures, 10 pages