使用语言无关BERT句子嵌入(LaBSE)检测冗余健康调查问题
计算与语言
2024-12-06 v1
摘要
本工作旨在计算公开可得的健康调查问题之间的语义相似度,以促进基于调查的个人生成健康数据(PGHD)的标准化。我们汇集了来自NIH CDE Repository、PROMIS、韩国公共卫生部门及学术出版物的各类健康调查问题,这些问题以英文和韩文编写。从各类健康生活日志领域中抽取问题,采用随机配对方案生成由1758对问题组成的语义文本相似度(STS)数据集。由两位人类专家为每对问题分配相似度分数。随后,我们构建了三个分类器:基于词袋的模型、基于BERT嵌入的SBERT模型,以及基于LaBSE嵌入的SBERT-LaBSE模型。算法采用传统概率统计进行评估。在三个算法中,SBERT-LaBSE在跨语言语义相似度评估方面表现最佳,在ROC曲线和精确召回曲线下面积均超过0.99。此外,它在识别跨语言语义相似性方面也同样有效。SBERT-LaBSE算法在跨语言语义等价句子对齐方面表现出色,但在捕捉细微差异和保持计算效率方面存在挑战。未来研究应聚焦于使用更大规模的多语言数据集,并对健康生活日志领域中的得分进行校准和标准化,以提高一致性。本研究提出了SBERT-LaBSE算法,用于计算两种语言之间的语义相似度,显示其优于基于BERT的模型和词袋方法,凸显了其在跨语言障碍中提高基于调查的PGHD语义互操作性的潜力。
引用
@article{arxiv.2412.03817,
title = {Detecting Redundant Health Survey Questions Using Language-agnostic BERT Sentence Embedding (LaBSE)},
author = {Sunghoon Kang and Hyeoneui Kim and Hyewon Park and Ricky Taira},
journal= {arXiv preprint arXiv:2412.03817},
year = {2024}
}