中文

基于 BERT 的无监督通话记录信息抽取范式

信息检索 2021-12-30 v3

摘要

音频通话记录是理解客户声音和分析坐席表现等多种下游用例的宝贵信息来源之一。然而,这些记录本身含有噪声,且在工业环境中获取带标注的真值数据是一项挑战。在本文中,我们介绍了一种在工业界实现的解决方案,该方案将 BERT 语言模型作为流水线的一部分,用于抽取通话中讨论的关键主题与多个开放意图。我们关注的另一个问题是将通话记录自动标注到预定义类别中,传统上该问题通过监督方法解决。为克服标注数据匮乏的困难,我们提出的所有方法均采用无监督方法来解决上述若干问题。我们通过将自动抽取的主题、意图和标注类别与人工标注的真值进行定量比较,并通过定性衡量真值中未涵盖的有价值概念与意图,对结果进行评估。借助我们的新方法,在这些主题与意图的抽取上达到了接近人工的准确率。

关键词

引用

@article{arxiv.2110.00949,
  title  = {Unsupervised paradigm for information extraction from transcripts using BERT},
  author = {Aravind Chandramouli and Siddharth Shukla and Neeti Nair and Shiven Purohit and Shubham Pandey and Murali Mohana Krishna Dandu},
  journal= {arXiv preprint arXiv:2110.00949},
  year   = {2021}
}