学习表示的学习表示
计算与语言
2024-06-06 v1 数字图书馆
机器学习
摘要
ICLR 会议在顶级机器学习会议中独树一帜,因为所有提交的论文都是公开可获取的。在此,我们提出了 ICLR 数据集,包含 2017 年至 2024 年所有 2.4 万份 ICLR 提交论文的摘要,以及元数据、决策分数和基于自定义关键词的标签。我们发现在该数据集上,词袋表示在 NN 分类准确率方面优于大多数专用的句子 Transformer 模型,且表现最好的语言模型勉强优于 TF-IDF。我们将其视为对 NLP 社区的一项挑战。此外,我们使用 ICLR 数据集研究了机器学习领域在过去七年中的变化,发现性别平衡有所改善。利用摘要文本的 2D 嵌入,我们描述了从 2017 年到 2024 年研究主题的转变,并在 ICLR 提交数量最多的作者中识别出了“刺猬”与“狐狸”。
引用
@article{arxiv.2404.08403,
title = {Learning representations of learning representations},
author = {Rita González-Márquez and Dmitry Kobak},
journal= {arXiv preprint arXiv:2404.08403},
year = {2024}
}