摘要:在人工智能快速迭代发展的时代背景下,AI公共语料库已成为驱动智能涌现、赋能经济社会高质量发展的新基建。然而,既有研究多聚焦于传统语料库建设或结构化公共数据开发利用,对适配AI模型训练需求的公共语料库的概念及其治理关注不足。为此,研究系统构建了AI公共语料库的概念内涵与就绪框架。首先,界定了AI公共语料库的技术性内涵,厘清其与相关概念的关联和差异,进而从本体属性、权利属性、价值属性三个维度解析其公共性特征。在此基础上,构建了技术性就绪-公共性就绪双主线就绪框架。其中,技术性就绪涵盖可发现性、可访问性、可用性、可训练性与可信性五个核心要素,聚焦语料质量与技术适配性;公共性就绪包括公开性、普惠性、共创性与正当性四个关键维度,强调语料的公平供给与公共价值。此外,研究还探讨了提升AI公共语料库就绪度的实践路径。研究结论有助于深化智能时代背景下公共语料资源的理论认知,为我国构建AI就绪、公平可及、内容向善的公共语料基础设施提供实践参考。
关键词:人工智能;公共数据;语料库;AI就绪;高质量数据集
作者:郑磊,全球人工智能创新治理中心研究员,复旦大学国际关系与公共事务学院教授,博士生导师,数字与移动治理实验室主任
杨涛,复旦大学国际关系与公共事务学院博士研究生,复旦大学数字与移动治理实验室研究助理
来源:《电子政务》2026年第04期(总第280期)
发表日期:2026/4/28
