贵州数据集(语料)服务平台上架118套高质量数据集,数据总规模超700TB
近日,贵州省大数据发展管理局公布最新数据:贵州数据集(语料)服务平台已上架118个高质量数据集,总数据规模突破700TB,240余家生态伙伴入驻共建,建成覆盖多领域、多模态的多层次语料资源体系。

该平台由贵州省大数据发展管理局指导、贵州大数据集团建设运营的贵州数据集(语料)服务平台正式上线运行。平台定位为“语料超市、语料加工厂、语料生态枢纽”,一站式补齐人工智能产业高质量数据供给短板,为全国大模型训练、行业AI应用提供合规、可溯源的数据支撑。
当前AI产业普遍存在供需痛点:持有原始数据的机构缺乏标准化加工、合规流通渠道,研发行业大模型的企业、科研院所却遭遇优质语料“找不着、买不起、用不上”难题。该平台打通数据资源到AI落地全链条,集成资源汇聚、数据治理、多模态标注、合规审查、交易交付、模型微调、应用孵化全流程服务,推动贵州从“数据仓库”向“数据工厂”转型。

平台依托贵州山地、民族、产业独特禀赋,搭建公共、产业、科研三大数据矩阵,覆盖十余个核心赛道。政务板块汇聚521万条民生热线知识库、千万级城市运行事件数据;少数民族语种板块储备苗、布依、侗、水等稀缺双语平行语料;山地气象拥有超9TB喀斯特卫星遥感数据;智慧“三农”集成29万张农作物标注图像;医疗板块提供脱敏临床病历、5TB医学影像;司法领域储备2000万份裁判文书,同时配套智能工业、文化教育、智慧交通及月球科学、人口迁徙等特色稀缺数据集。数据形态涵盖文本、表格、图像、音频、视频、多模态融合六大门类,适配预训练、微调、计算机视觉、语音识别等各类研发场景。

平台设置标准化使用流程,实现供需高效匹配。供给方可线上入驻,享受清洗、标注、脱敏一站式加工,完成数据资产合规变现;需求方能多维度检索、预览评估数据集,提交申请经授权后通过专属通道交付,全流程操作留痕可追溯。针对细分定制需求,平台可联动服务商提供专属数据集生产服务,构建全周期数据安全合规防护体系,保障供需双方安心合作。
下一步,平台将持续扩充特色语料品类、严控数据质量,围绕产业真实需求迭代高价值数据集,联动全省政企、科研机构汇聚优质数据资源,把贵州独特数据资源优势转化为数字产业竞争优势。

