基于非临床文本信息检索的癌症相关论坛帖子计算高效标注
信息检索
2023-03-30 v1 人工智能
分布式、并行与集群计算
机器学习
摘要
网上存在大量癌症相关信息,但对其分类和提取有用信息十分困难。医疗数据处理领域的研究几乎都关注正式的临床数据,但非临床数据中也有有价值的信息。本研究将分布式计算、文本检索、聚类和分类的方法结合为一个连贯且计算高效的系统,可基于非临床且自由可用的信息厘清癌症患者轨迹。我们构建了一个全功能原型,能从非临床论坛帖子中检索、聚类并呈现癌症轨迹信息。我们评估了三种聚类算法(MR-DBSCAN、DBSCAN 和 HDBSCAN),并根据检索帖子数量和邻域半径比较它们的调整兰德指数与总运行时间。聚类结果显示邻域半径对聚类性能影响最显著。取值较小时数据集相应被切分,但取值较大时会产生大量可能划分,寻找最佳划分因而耗时。在合理估计半径下,MR-DBSCAN 可在 46.1 秒内聚类 50000 条论坛帖子,而 DBSCAN 为 143.4 秒、HDBSCAN 为 282.3 秒。我们与丹麦癌症协会进行了访谈并展示了软件原型。该组织看到了能普及癌症在线信息的软件的潜力,并预见未来将需要此类系统。
引用
@article{arxiv.2303.16766,
title = {Computationally Efficient Labeling of Cancer Related Forum Posts by Non-Clinical Text Information Retrieval},
author = {Jimmi Agerskov and Kristian Nielsen and Christian Marius Lillelund and Christian Fischer Pedersen},
journal= {arXiv preprint arXiv:2303.16766},
year = {2023}
}