从文本中提取临床标志物的低成本方法
计算与语言
2024-03-19 v1 机器学习
摘要
本文介绍了 UniBuc Archaeology 团队为 CLPsych 2024 共享任务所做的工作,该任务涉及在文本中寻找支持所判定自杀风险等级的证据。需要两类证据:高亮(在文本中提取相关片段)和摘要(将证据聚合为综合概述)。我们的工作重点是评估大型语言模型(LLM),并将其与一种内存和资源效率高得多的替代方法进行对比。第一种方法采用传统的机器学习(GOML)流水线,由 tf-idf 向量化器和 logistic 回归分类器组成,利用其代表性特征提取相关高亮。第二种方法资源消耗更大,使用 LLM 生成摘要,并在思维链的引导下提供指示临床标志物的文本序列。
引用
@article{arxiv.2403.11227,
title = {Cheap Ways of Extracting Clinical Markers from Texts},
author = {Anastasia Sandu and Teodor Mihailescu and Sergiu Nisioi},
journal= {arXiv preprint arXiv:2403.11227},
year = {2024}
}
备注
https://github.com/nlp-unibuc/clpsych24-task