探索未标记数据在金融情感分析中的贡献
计算与语言
2013-08-06 v1 机器学习
摘要
随着其应用在各行业的普及,利用公开可用的 Web 数据进行情感分析已成为近年来文本分类中的一个活跃研究领域。研究人员认为,半监督学习是解决此问题的有效方法,因为它能够减轻通常昂贵且耗时的手动标注工作。然而,关于未标记数据在文本分类中的有效性存在长期的争论。这部分原因是理论分析中的许多假设在实践中往往不成立。我们认为,通过在实验中增加一个额外的维度,可以进一步理解这个问题。这使我们能够从更广阔的视角,基于偏差和方差来解决这个问题。我们表明,由未标记数据引起的众所周知的性能下降问题可以作为整个场景的一个子集被复现。我们认为,如果通过更有效的特征选择方法来更好地平衡偏差 - 方差权衡,未标记数据非常有可能提升分类性能。随后,我们提出了一个同时考虑标记和未标记训练样本的特征选择框架。我们讨论了其在实现这种平衡方面的潜力。此外,选择金融情感分析作为应用场景,不仅因为它代表了一个重要的应用,还因为其数据具有更好的说明力。本文讨论了该研究对文本分类和金融情感分析的启示。
引用
@article{arxiv.1308.0658,
title = {Exploring The Contribution of Unlabeled Data in Financial Sentiment Analysis},
author = {Jimmy SJ. Ren and Wei Wang and Jiawei Wang and Stephen Shaoyi Liao},
journal= {arXiv preprint arXiv:1308.0658},
year = {2013}
}
备注
Appeared in The 27th AAAI Conference on Artificial Intelligence (AAAI-13); Proceedings of AAAI-13 (AAAI Press 2013) pp. 1149-1155