中文

RiverText:用于从文本数据流中训练和评估增量词嵌入的 Python 库

计算与语言 2025-07-01 v1 机器学习

摘要

词嵌入已成为各种信息检索和自然语言处理任务中的关键组件,如排序、文档分类和问答。然而,尽管其应用广泛,传统词嵌入模型存在静态性,限制了其适应来自社交媒体和网络等源不断演变的语言模式(例如新的标签或品牌名称)的能力。为克服这一问题,引入增量词嵌入算法,能够动态更新词语表征以响应新的语言模式,并处理连续的数据流。本文介绍了 RiverText,一个用于从文本数据流中训练和评估增量词嵌入的 Python 库。该工具是面向信息检索和自然语言处理社区的资源,适用于处理数据流中的词嵌入场景,如社交媒体分析。该库在标准化框架下实现了各种增量词嵌入技术,包括 Skip-gram、Continuous Bag of Words 和 Word Context Matrix。此外,它使用 PyTorch 作为神经网络训练的后端。我们实现了一个模块,将现有的静态词嵌入评估任务(用于词相似度和词分类)适配到数据流设置。最后,我们比较不同超参数设置下的实现方法并讨论结果。该开源库已发布在 https://github.com/dccuchile/rivertext。

关键词

引用

@article{arxiv.2506.23192,
  title  = {RiverText: A Python Library for Training and Evaluating Incremental Word Embeddings from Text Data Streams},
  author = {Gabriel Iturra-Bocaz and Felipe Bravo-Marquez},
  journal= {arXiv preprint arXiv:2506.23192},
  year   = {2025}
}

备注

Accepted at SIGIR'23