中文

Twitter 上个人就业状态的多语言检测

计算与语言 2022-06-14 v1

摘要

在社交媒体上检测个人就业状态的披露,可提供有价值的信息以匹配求职者与合适空缺岗位、提供社会保护或衡量劳动力市场流动。然而,由于此类个人披露在海量社交媒体内容中极为稀少,且描述所用语言形式多样,识别它们是一项挑战性任务。在此,我们考察了极端类别不平衡真实场景下的三种主动学习(AL)策略,并使用基于 BERT 的分类模型在三种语言中识别五类个人就业状态披露(如失业)。我们的结果表明,即便在极端不平衡设置下,少量 AL 迭代便足以相比同等标注量的监督基线在精确率、召回率与结果多样性上获得显著且大幅的提升。我们还发现没有任何一种 AL 策略持续优于其余策略。定性分析表明,AL 有助于将 BERT 的注意力机制聚焦于核心词并调整语义扩展的边界,凸显了可解释模型对于在这一动态学习过程中提供更强控制与可见性的重要性。

关键词

引用

@article{arxiv.2203.09178,
  title  = {Multilingual Detection of Personal Employment Status on Twitter},
  author = {Manuel Tonneau and Dhaval Adjodah and João Palotti and Nir Grinberg and Samuel Fraiberger},
  journal= {arXiv preprint arXiv:2203.09178},
  year   = {2022}
}

备注

ACL 2022 main conference. Data and models available at https://github.com/manueltonneau/twitter-unemployment