良债还是坏债:检测经济文本中的语义取向
计算与语言
2013-07-24 v2 信息检索
计算金融
摘要
使用自动阅读器分析新闻文本是计算金融中新兴的技术趋势。在最近的研究中,人们投入了大量精力开发复杂的金融极性词典,用于研究金融情感如何与公司未来表现相关联。然而,基于情感分析常用领域的经验,众所周知,句子的整体语义取向可能与单个词汇的先验极性不同。本文旨在通过结合整体短语结构信息和特定领域的语言用法,研究如何更好地检测金融和经济新闻中的语义取向。我们的三个主要贡献是:(1) 建立一个人工标注的金融短语库,可作为训练和评估替代模型的基准;(2) 提出一种技术,通过添加有助于识别影响整体情感的事件预期方向的属性来增强金融词典;(3) 开发一种线性化短语结构模型,用于检测金融和经济新闻文本中的上下文语义取向。在一项对比研究中,我们展示了新添加的词典特征的相关性以及使用所提出的学习算法的益处,该对比研究针对先前使用的通用情感模型以及近期金融研究中流行的词频模型。所提出的框架简洁明了,避免了因使用传统 n-gram 特征而导致的特征空间爆炸。
引用
@article{arxiv.1307.5336,
title = {Good Debt or Bad Debt: Detecting Semantic Orientations in Economic Texts},
author = {Pekka Malo and Ankur Sinha and Pyry Takala and Pekka Korhonen and Jyrki Wallenius},
journal= {arXiv preprint arXiv:1307.5336},
year = {2013}
}
备注
To be published in Journal of the American Society for Information Science and Technology