中文

促进领域专家向数据科学家共享知识以构建 NLP 模型

人机交互 2023-11-14 v1 机器学习

摘要

数据科学家在理解其希望构建机器学习 (ML) 模型的新领域时面临陡峭的学习曲线。虽然领域专家的输入可提供宝贵帮助,但此类输入通常有限、昂贵,且一般不是模型开发流程可直接使用的形态。在本文中,我们提出 Ziva,一个引导领域专家向数据科学家共享构建 NLP 模型所需关键领域知识的框架。借助 Ziva,专家能够通过领域概念提取器以及针对代表性数据样本的五种标注依据类型来提炼并共享其领域知识。Ziva 的设计基于对数据科学家的初步访谈,以了解当前 ML 开发项目中领域知识获取流程的实践情况。为评估我们的设计,我们开展了一项混合方法案例研究,以评价 Ziva 如何促进领域专家与数据科学家的交互。我们的结果强调:(1) 领域专家能够使用 Ziva 提供丰富的领域知识,同时保持较低的心理负荷与压力水平;(2) 数据科学家认为 Ziva 的输出有助于学习领域关键信息、提供信息的可扩展性,并降低领域专家共享知识的负担。我们通过使用案例研究中 Ziva 的输出构建 NLP 模型来结束本工作。

关键词

引用

@article{arxiv.2102.00036,
  title  = {Facilitating Knowledge Sharing from Domain Experts to Data Scientists for Building NLP Models},
  author = {Soya Park and April Wang and Ban Kawas and Q. Vera Liao and David Piorkowski and Marina Danilevsky},
  journal= {arXiv preprint arXiv:2102.00036},
  year   = {2023}
}