中文

印度语言医疗查询的意图识别与实体抽取

信息检索 2023-03-28 v1 计算与语言

摘要

印度等发展中国家资源匮乏语言的数据稀缺与技术限制,对构建复杂的医疗自然语言理解系统构成威胁。为评估各种最先进语言模型在医疗领域的现状,本文通过最初提出两个不同医疗数据集——Indian Healthcare Query Intent-WebMD 与 1mg(IHQID-WebMD 与 IHQID-1mg)以及一个真实世界的印度医院查询数据(含英语与多种印度语言: Hindi、Bengali、Tamil、Telugu、Marathi 与 Gujarati),来研究该问题,这些数据均标注了查询意图与实体。我们的目标是检测查询意图并抽取相应实体。我们在多种现实设定下对一组模型进行了广泛实验,并探索了仅能获取英语数据(成本较低)与能获取目标语言数据(成本较高)两种场景。我们通过实证分析探讨了上下文特定的实际相关性。以总体 F1 分数表示的结果表明,我们的方法在识别意图与实体方面具有实际效用。

关键词

引用

@article{arxiv.2302.09685,
  title  = {Intent Identification and Entity Extraction for Healthcare Queries in Indic Languages},
  author = {Ankan Mullick and Ishani Mondal and Sourjyadip Ray and R Raghav and G Sai Chaitanya and Pawan Goyal},
  journal= {arXiv preprint arXiv:2302.09685},
  year   = {2023}
}