RTI-Bench:面向印度信息权利决策分析的结构化数据集
计算与语言
2026-05-19 v1
摘要
印度信息权利法案2005年赋予每个公民向公共机构要求获取信息的权利,但实际中大多数人无法理解中央信息委员会(CIC)决策中使用的密集行政语言,更别说预测申诉是否值得提出。本文介绍RTI-Bench,这是一个包含CIC决策结果标签、豁免引用、IRAC风格论证组件及程序时间线的结构化数据集。迄今为止,唯一一个公开发布的印度RTI行政决策结构化数据集。该数据集来源于两个数据源:来自公开可用的指令-响应语料库的1218个案例(通过基于规则的抽取添加了结构化字段),以及从委员会门户网站直接收集的298份CIC决策PDF文件,涵盖2023年至2026年期间的五位委员和三个文档格式版本。指令-响应语料库的标签覆盖率达到89%,在首次发布的PDF子集239份primary decisions中,覆盖率为51%。对50个标注案例进行随机抽样手动审核,标签精度达95.3%。在100个案例上进行的零样态Mistral 7B基线测试,准确率为57.3%,宏平均F1为37.0%,显著优于基于多数类基线的14.3%宏平均F1。RTI-Bench数据集已提供于https://huggingface.co/datasets/joyboseroy/rti-bench
引用
@article{arxiv.2605.16843,
title = {RTI-Bench: A Structured Dataset for Indian Right-to-Information Decision Analysis},
author = {Joy Bose},
journal= {arXiv preprint arXiv:2605.16843},
year = {2026}
}
备注
8 pages, 4 tables