中文

XferBench:面向涌现语言的数据驱动基准测试

计算与语言 2024-07-08 v1

摘要

在本文中,我们引入了一个基准测试,用于使用数据驱动方法评估涌现语言的整体质量。具体而言,我们将涌现语言的“质量”这一概念解释为在深度学习框架下其与人类语言的相似度。我们通过将涌现语言作为人类语言下游 NLP 任务的预训练数据来衡量这一点——下游性能越好,涌现语言越好。我们将此基准测试实现为一个易于使用的 Python 包,只需提供待评估涌现语言的文本文件即可。最后,我们使用人类语言、合成语言和涌现语言基线对基准测试的有效性进行了实证检验。

关键词

引用

@article{arxiv.2407.03456,
  title  = {XferBench: a Data-Driven Benchmark for Emergent Language},
  author = {Brendon Boldt and David Mortensen},
  journal= {arXiv preprint arXiv:2407.03456},
  year   = {2024}
}

备注

15 pages, 5 figures