预训练语言模型用于检测冲突健康信息的适用范围
计算与语言
2022-09-23 v1
摘要
如今越来越多的人依赖在线平台满足其健康信息需求。因此,识别不一致或冲突的文本健康信息已成为一项安全关键任务。健康建议数据带来独特挑战:在某一诊断背景下准确的信息,在另一诊断背景下可能相互冲突。例如,糖尿病与高血压患者常收到关于饮食的冲突健康建议。这催生了对能够提供情境化、用户特定健康建议技术的需求。实现情境化建议的关键一步,是比较健康建议陈述并检测它们是否及如何冲突。此即健康冲突检测(HCD)任务。给定两条健康建议,HCD 的目标是检测并分类冲突类型。这是一项具有挑战性的任务,因为(i)自动识别与分类冲突需要更深入理解文本语义,(ii)可用数据量相当有限。本研究中,我们首次探索 HCD 在预训练语言模型背景下的表现。我们发现 DeBERTa-v3 表现最佳,在所有实验中平均 F1 得分为 0.68。我们还额外研究了不同冲突类型带来的挑战,以及合成数据如何提升模型对冲突特定语义的理解。最后,我们强调收集真实健康冲突的困难,并提出一种人在回路的合成数据增强方法来扩展现有 HCD 数据集。我们的 HCD 训练数据集比现有 HCD 数据集大 2 倍以上,并已公开于 Github。
引用
@article{arxiv.2209.11102,
title = {Scope of Pre-trained Language Models for Detecting Conflicting Health Information},
author = {Joseph Gatto and Madhusudan Basak and Sarah M. Preum},
journal= {arXiv preprint arXiv:2209.11102},
year = {2022}
}