01.开篇
2026年7月, 浙江省市场监管局发布了30件数据知识产权典型案例, 这些案例在温州发展大会上被公布, 它们涵盖五大应用场景, 所涉范围从大模型训练到自动驾驶领域, 从精准育种到公共治理范畴, 每一条数据于真实产业里都产生了可量化的价值, 而这是全国首个省级数据知识产权成果的集中亮相。
02.静态手势识别数据
由正数智慧公司所登记的静态手势识别数据, 是专门被用于智能设备当中的非接触式控制的, 没错。
这套数据集合, 涵盖了数量达数十万组的, 不同种类手势的, 处于多种光照条件之下的图像, 据此训练而成的模型, 其识别准确率, 达到了98.7%。
医院消毒机器人控制, 在杭州部分医院已被应用, 医生完成操作指令, 无需触摸屏幕。
该数据的关键创新在于解决了手势在复杂背景下的边缘切割难题。
这套数据, 覆盖了50种常见手势, 每种手势都有1000个以上样本, 与传统手势识别方案相比, 有效降低的是模型误判率。
项目团队表示,下一步将扩展至工厂车间的机械臂手势操控场景。
03.天基遥感大模型指令微调数据
之江实验室所构建的, 用于天基遥感大模型指令微调的数据, 填补了国内遥感领域专用训练数据方面的空白。
这套数据含有多于10万条的, 卫星遥感图像跟对应指令的配对样本, 其覆盖了灾害监测任务, 覆盖了农业估产任务, 覆盖了城市变化检测等六大全球对地观测任务。
该数据集的独特价值在于其标注质量。
每一条数据, 均经由遥感方面的专家知识产权数据应用案例_数据知识产权典型案例,进行了双重的校验, 指令跟图像二者的对齐精度, 达成了像素级别的程度。
於2026年4月之时衡估湖南洪水灾害期间, 借助此数值予以训练的模型, 于24小时之内达成了受灾区自动辨认, 此举较諸人工判读速率快达40倍。
04.代码生成训练数据
杭州景联文科技公司有的代码生成训练数据, 是专门用来提升大模型理解代码精准度的, 也是用于提升大模型生成代码精准度的。
这个数据集含有200万条这样的代码片段 , 这些代码片段是Python和Java的 , 并且每条代码片段都配备有自然语言描述 、配备有多种正确实现方案。
关键之突破体现于, 数据历经了严谨规范专门设定限定的编译验证, 唯有能够顺次通过编译的代码, 才会被收纳进入。
该数据在多个开源大模型的测试中表现突出。
采用这套数据予以微调之后, 模型于代码生成任务方面的准确率, 从百分之六十七提升到百分之八十三, 并且代码编译一次通过率, 从百分之四十五跃升为百分之七十一。
市面上, 已然存在3家, 投身于AI领域进行创业的公司, 采购了此项数据, 目的在于开发面向垂直领域的代码助手工具。
05.声音意图识别训练数据
杭州秋果计划科技所拥有的声音意图识别训练数据, 目标在于达成更为自然的人机交互, 其为此付出诸多努力。
有一套数据, 采集了5000名说话人, 这些说话人年龄不同、地域各异, 在40种日常场景下的语音样本,并且每条语音样本都被标注了情绪、意图以及背景噪声类型。
数据的总量达到了80TB, 它成为了当前国内规模最大的中文声音意图识别方面的开源数据集。
核心创新点在于覆盖了“非语言信息”的标注。
这数据, 除了有文字被转录的情况, 还作了标注, 标注的是语气、音量、语速等条件下, 13个维度的声学特征。
处于车载语音助手的测试里面, 依据该数据进行训练的模型, 对于乘客语音发出的指令的意图识别, 其准确率是达到百分之九十二, 与行业平均水平相比较, 高出十五个百分点。
06.水稻受旱模拟预测数据
浙江绿迹农业科技所拥有的水稻, 其受旱模拟预测的相关数据, 能够为精准灌溉给予科学方面的依据。
该数据是依据五年里, 在浙江、江西、湖南这三省的200个试验田所得到的数据, 再结合气象卫星以及土壤传感器的数据, 进而构建出的, 包含54个变量的水稻旱情预测模型。
存在着数量为400万条的记录数据规模, 时间所覆盖的范围是从开始播种一直到结束收获的整个生育周期。
实际应用效果显著。
到2025年的时候, 在江西处于旱季的那段时期内, 那片用该数据来指导灌溉的试点农田, 其用水量降低了28%, 然而产量仅仅下降了3%。
对比传统经验灌溉方案,水分利用效率提升了42%。
浙江省的那个农业农村厅, 已然把这一套数据给纳入到智慧农业平台里边了, 计划在2027年之前, 实现覆盖全省100万亩稻田的目标。
07.带图几何习题数据
瓴羊智能科技所拥有的带图几何习题数据, 其目的在于提高AI模型的逻辑推理能力, 以及增强AI模型的图像理解能力。
此数据集涵盖三十万道初中几何题目, 每一道题皆配备精准标注的几何图形,及按步骤推理的过程。
难点在于, 对图形的拓扑关系进行标注, 每条线段都要标注相关关系, 每一个角度都得标注其空间关系, 每一个圆形同样都需标注所述的空间关系。
该数据对AI教育产品价值巨大。
运用该数据开展训练之后, 模型于几何证明题方面的解题正确比率由百分之十二提升到百分之六十一, 近乎初中生的平均水准。
杭州有一家教育科技公司, 它基于该数据开发了几何智能辅导系统, 此系统已在50所中学进行试点, 试点后学生做几何题目的正确率平均提高了23个百分点。
08.室内具身智能机器人训练数据
于室内具身智能机器人训练的3D场景数据, 是由杭州群核信息公司所供给的。
这套数据涵盖了数量为1万套的具备高精度特点的室内3D场景模型, 其中每个场景都增添了家具位置、材质属性、可交互区域等多达12层的信息标注。
数据有着达到毫米级别的分辨率, 能够对真实环境里的光影变化予以模拟, 还可以模拟其中的物理碰撞情况。
该数据有突破之处, 在于把传统仿真数据跟真实环境之间的“域迁移”问题给解决了。
2026年3月, 于之江实验室展开了机器人抓取测试, 在此测试里, 使用该数据进行训练的机器人, 针对陌生场景当中的物体, 其识别准确率达到了87%, 这一比率比起运用传统合成数据来训练, 进而得到的机器人识别准确率, 高出了31个百分点, 如此一来, 便极大地缩短了机器人落地部上的时间。
09.油菜全生育期三维表型数据库
浙江大学构建了全球首个油菜全生育期三维表型数据库。
该数据涵盖了自播种起始直至收获的整个完整生长周期, 囊括了28个品种的油菜于正常以及胁迫条件情形下的三维点云数据, 其总量超出了500TB。
每种油菜的数据, 都涵盖啦茎秆角度, 还有叶片分布, 以及角果密度等, 共计40个表型参数。
这项数据的核心价值在于为精准育种提供量化依据。
2025年, 借助该数据予以训练的AI模型, 成功识别出相关的关键表型基因位点有7个, 且这些基因位点都与产量有关。
在浙江与安徽这两个省份所开展的试点里头, 借助模型筛选出来的具备高产特性的品种, 将油菜籽的平均每亩产量提升了百分之十八点六, 并且把育种的周期从八年缩短到了四年。
10.混合现实空间3D人体姿态数据
杭州的一个角落, 千象科技所拥有的混合现实空间里的3D人体姿态数据, 能够为教育领域赋能, 能够为应急领域赋能, 还能够为安全领域赋能。
那次数据采集了两千名志愿者于混合现实环境里的活动数据 , 每一个样本含有全身二十六个关节点的三维坐标 , 还有时序运动轨迹。
数据量达50TB知识产权数据应用案例_数据知识产权典型案例,覆盖行走、奔跑、攀爬等100种动作模式。
该数据的独特之处在于包含了“空间交互”标注。
每一条数据, 都对人与虚拟物体之间的交互反馈, 做了记录, 像是伸手去触碰, 以及躲避障碍之类的情况的记录。
一家位于杭州的消防培训中心, 运用该数据研发出了VR应急演练系统, 使得受训人员的应急反应正确率由68%提高到91%, 并且培训时间减少了40%。
11.医疗心电分析训练数据
有一家名为浙江宁数健康公司的实体, 其拥有的医疗心电分析训练数据, 是通过处于公共数据授权运营这样一种状况之下, 进而为医生供给辅助诊断建议的。
这份数据含有五十万份进行了脱敏操作的心电记录, 其涵盖了正常心律以及十七种常见的心律失常类型, 而且每一条记录都经由最少两位心内科专家进行审核标注。
数据的来源之处, 是浙江省的三家属于三甲等级的医院, 从2020年开始, 一直到2025年期间所产生的临床方面的数据。
该数据在辅助诊断系统上的表现优异。
到2026年1月的时候, 有一场临床试验, 在这场试验当中, 系统对于房颤的识别能力, 其灵敏度达到了96.3%, 特异性达到了94.7%, 这一结果超过了一位具有高年资深资质的心内科医生的平均水平。
当下, 此系统于嘉兴市第一医院开展试点, 每日处理数量约300份的心电报告, 医生对每份报告的审核时间, 从平均5分钟缩减为2分钟。
12.自动驾驶仿真测试场景库数据
车网智联公司设立在德清县, 其自动驾驶仿真测试场景库的数据, 能用来提高自动驾驶算法的性能, 以及增强其安全性。
此场景库存有10万组具备高度仿真特质的场景, 其涵盖了城市道路、高速公路、乡村小道等8种类型, 着重对极端天气、突发障碍物、施工区域等500种边缘情形进行了覆盖。
查询商标代理机构运行状态请登录中知产业网
每个场景都包含激光雷达点云、摄像头图像和毫米波雷达数据。
该数据的核心价值在于场景的“冲突点”设计。
到了2025年之时 在德清之处自动驾驶测试场里 针对实际验证的情况而言 使用这个场景库予以训练的算法 在那些从未被见过的复杂场景当中 其接管率降低了 幅度达到 72%之多。
到当下这个时候, 德清县已然把那数据给开放了, 让8家从事自动驾驶的企业运用, 用以开展平常的算法测试, 以及进行合规认证。
13.影视文旅实拍视频数据
数字, 是浙江时光坐标公司的影视文旅实拍视频所拥有的。并且, 该些数据实现了对于虚拟拍摄以及视觉特效制作方面的创新应用。
此数据含有500小时时长的, 为4K分辨率的实拍视频素材, 其覆盖了中国20个景区的, 关于四季变化的情况, 以及早中晚不同时段的光照条件。
每一条视频, 都做了深度标注, 诸如场景类别, 光照模型, 相机参数, 还有运动轨迹。
该数据发挥了关键作用, 在2026年春节档电影《山海经》, 于此的虚拟拍摄当中。
剧组运用这些数据, 生成了逼真的外景背景, 以此替代了传统绿幕拍摄, 此番操作节省了外景拍摄费用, 大约是800万元。
制作周期, 原本是6个月的时长, 现在缩短到了3个半月, 与此同时, 画面的质感, 提高了一个等级。
14.玻璃纤维织物力学性能预测数据
浙江振石新材料公司有关于玻璃纤维织物力学性能的预测数据, 以此构建了一个体系, 这个体系覆盖全链条, 是“工艺 - 性能”数字化映射体系。
数据整合了企业17年生产的2000多种玻璃纤维织物工艺参数, 数据整合了企业17年玻璃纤维织物力学测试结果, 数据共计15万条记录, 数据涵盖编织密度, 数据涵盖纤维直径, 数据涵盖树脂浸润度等32个工艺变量, 数据涵盖12个性能指标。
该数据的核心突破在于实现了产品研发的“反向设计”。
到2025年的时候, 只要工程师把目标性能参数进行输入, 针对此系统而言, 便能够自动将最优工艺组合做出推荐, 就新产品的研发周期来讲, 从平均6个月的时长缩短到了45天的时间。
那时候, 为企业节省了实验材料方面的费用, 超过了300万元, 与此同时, 研发产品的合格率, 从78%提升成了93%。
15.钢结构阶段识别模型数据
对于杭州等地隶属于其它公司的钢结构所处阶段进行区别的模型所具的数据, 借由深度学习这项技术达成使施工期间各项环节进展清晰呈现、便于管理的目的。