从废话或混乱社交媒体文本中检索 Emoji:一种新方法与案例研究
社会与信息网络
2024-12-25 v1 人工智能
计算与语言
计算机与社会
机器学习
摘要
Emoji在社交媒体平台上广泛使用,但常在噪声或混乱文本中被忽略,这给数据分析和机器学习带来挑战。常规预处理方法建议删除此类文本,可能导致 Emoji及其上下文意义的丢失。本文提出一种三步逆向工程方法,用于从社交媒体帖子中的混乱文本中检索 Emoji。该方法还识别了社交媒体数据挖掘中生成此类文本的原因。为评估其有效性,我们将该方法应用于关于Mpox暴发的509,248条推文,该数据集在约30篇先前文献中被引用,但未能从混乱文本中检索 Emoji。我们从76,914条推文中检索到了157,748个 Emoji。通过Flesch阅读难度、Flesch-Kincaid年级水平、Coleman-Liau指数、自动可读性指数、Dale-Chall可读性得分、文本标准和阅读时间等指标,展示了文本可读性和连贯性的改善。此外,还分析了 individual Emoji的频率及其在这些推文中的使用模式,结果如此呈现。
引用
@article{arxiv.2412.18046,
title = {Emoji Retrieval from Gibberish or Garbled Social Media Text: A Novel Methodology and A Case Study},
author = {Shuqi Cui and Nirmalya Thakur and Audrey Poon},
journal= {arXiv preprint arXiv:2412.18046},
year = {2024}
}