中文

从文本中自动提取人格:挑战与机遇

计算与语言 2019-10-23 v1

摘要

在本研究中,我们考察了从文本中提取人格特质的可能性。我们通过让专家对来自多个在线源的大量文本中的人格特质进行标注,创建了一个广泛的数据集。从这些标注文本中,我们选取了一个样本并做了进一步标注,最终得到一个大型低可靠数据集和一个小型高可靠数据集。随后我们使用这两个数据集训练并测试了若干从文本中提取人格的机器学习模型,包括一个语言模型。最后,我们在不同领域的数据集上于真实环境中评估了我们的最佳模型。我们的结果显示,基于小型高可靠数据集的模型比基于大型低可靠数据集的模型表现更好(就 R2\textrm{R}^2 而言)。同时,基于小型高可靠数据集的语言模型表现优于随机基线。最后且更重要的是,结果显示我们的最佳模型在真实环境测试中并未优于随机基线。综上,我们的结果表明从文本中判定人格特质仍是一项挑战,且在真实环境测试之前无法对模型性能得出确切结论。

关键词

引用

@article{arxiv.1910.09916,
  title  = {Automatic Extraction of Personality from Text: Challenges and Opportunities},
  author = {Nazar Akrami and Johan Fernquist and Tim Isbister and Lisa Kaati and Björn Pelzer},
  journal= {arXiv preprint arXiv:1910.09916},
  year   = {2019}
}