XferBench:面向涌现语言的数据驱动基准测试
计算与语言
2024-07-08 v1
摘要
在本文中,我们引入了一个基准测试,用于使用数据驱动方法评估涌现语言的整体质量。具体而言,我们将涌现语言的“质量”这一概念解释为在深度学习框架下其与人类语言的相似度。我们通过将涌现语言作为人类语言下游 NLP 任务的预训练数据来衡量这一点——下游性能越好,涌现语言越好。我们将此基准测试实现为一个易于使用的 Python 包,只需提供待评估涌现语言的文本文件即可。最后,我们使用人类语言、合成语言和涌现语言基线对基准测试的有效性进行了实证检验。
引用
@article{arxiv.2407.03456,
title = {XferBench: a Data-Driven Benchmark for Emergent Language},
author = {Brendon Boldt and David Mortensen},
journal= {arXiv preprint arXiv:2407.03456},
year = {2024}
}
备注
15 pages, 5 figures