文本数据分布:基于 GPT-2 生成文本的 Kullback-Leibler 文本分布对比及在疫苗与市场主题和情感上的监督与无监督学习
计算与语言
2021-07-06 v1 机器学习
社会与信息网络
摘要
高效的文本数据分布(TDD)对齐与生成是文本分析与 NLP 中的开放研究问题。目前难以简洁且方法论地确认两个或多个自然语言数据集属于相似分布,并识别文本数据具有对齐的程度。本研究通过应用多种监督与无监督机器学习(ML)方法,从(i)主题对齐与(ii)情感对齐两方面探究 TDD 的行为,以解决上述更广泛问题中的一部分。此外,我们使用包括微调 GPT-2 在内的多种文本生成方法,按主题与按情感生成文本。最后,我们开发了 Kullback-Leibler 散度(KLD)应用于 TDD 的一种独特过程驱动变体,称为 KL 文本分布对比(KL-TDC),以识别机器生成文本语料库与自然发生文本语料库的对齐情况。因此,本研究识别了一种按主题与情感生成并验证 TDD 的独特方法,可用于帮助解决稀疏数据问题以及需要人工生成的主题或情感对齐文本数据的其他研究、实践与教学情境。
引用
@article{arxiv.2107.02025,
title = {Textual Data Distributions: Kullback Leibler Textual Distributions Contrasts on GPT-2 Generated Texts, with Supervised, Unsupervised Learning on Vaccine & Market Topics & Sentiment},
author = {Jim Samuel and Ratnakar Palle and Eduardo Correa Soares},
journal= {arXiv preprint arXiv:2107.02025},
year = {2021}
}