使用文本嵌入模型作为医学数据文本分类器
信息检索
2024-12-04 v2 人工智能
机器学习
摘要
大型语言模型(LLM)的出现前景广阔,并已应用于众多领域。然而,由于对精确度和准确性的高标准要求,在医学领域实施LLM并非易事。目前,医学疾病的诊断必须手动进行,因为构建一个能够诊断广泛疾病的足够广泛的LLM成本高昂。在此,我们探索使用向量数据库和嵌入模型作为编码和分类医学文本数据的手段,而无需从头训练新模型。我们使用各种LLM生成医学数据,然后用文本嵌入模型对数据进行编码,并将其存储在向量数据库中。我们假设更高的嵌入维度结合向量数据库中的描述性数据将带来更好的分类,并设计了一个鲁棒性测试来验证我们的假设。通过使用向量数据库和文本嵌入模型对临床医生关于呈现某种疾病的患者的笔记进行分类,我们展示了这些工具能够成功地对医学文本数据进行分类。我们发现更高的嵌入维度确实产生了更好的结果,然而,在数据库中使用简单数据进行查询对于性能是最优的。在本研究中,我们展示了文本嵌入模型和向量数据库在小规模上的适用性,我们的工作为将这些工具应用于更大规模奠定了基础。
引用
@article{arxiv.2402.16886,
title = {Using text embedding models as text classifiers with medical data},
author = {Rishabh Goel},
journal= {arXiv preprint arXiv:2402.16886},
year = {2024}
}
备注
15 pages, 6 figures