DLT-Corpus:分布式账本技术领域的大规模文本集合
计算与语言
2026-05-29 v2
摘要
我们介绍DLT-Corpus——目前为Distributed Ledger Technology(DLT)研究构建的最大规模领域特定文本集合:包含298亿个token,覆盖2212万个文档,包括科学文献(37,440篇出版物)、美国专利商标局(USPTO)专利(49,023件申请)以及社交媒体(2200万篇帖子)。现有的DLT自然语言处理资源仅聚焦于加密货币价格预测和智能合约,导致该领域的特定语言研究不足,尽管该部门约有3万亿美元的市值规模并正在快速技术演化。我们通过分析技术出现模式和市场创新相关性来展示DLT-Corpus的实用性。研究发现,技术首先出现在科学文献子集中,然后到达专利和社交媒体,遵循传统技术迁移模式。尽管社交媒体情感始终偏向乐观,即便在加密货币冬季期间亦如此,但科学和专利活动与短期情感关联性较弱,更多地追随整体市场扩张,形成一个以研究为先驱、驱动经济增长的良性循环,而增长所获经济利润又反哺后续创新。我们发布DLT-Corpus及伴随性制品:LedgerBERT(在DLT特定命名实体识别(NER)任务上超越BERT-base 23%)、包含23,301篇加密货币新闻标题和描述的情感分析数据集、工具以及代码。
引用
@article{arxiv.2602.22045,
title = {DLT-Corpus: A Large-Scale Text Collection for the Distributed Ledger Technology Domain},
author = {Walter Hernandez Cruz and Peter Devine and Nikhil Vadgama and Paolo Tasca and Jiahua Xu},
journal= {arXiv preprint arXiv:2602.22045},
year = {2026}
}
备注
Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD '26)