免费数据质量管理平台·查看详情

AI应用加速落地,企业为什么要重新重视数据治理?

公共大模型的能力在过去两年中飞速提升,但一个矛盾正在企业端越来越明显:模型换了、算力加了,AI问数、知识问答和智能决策仍然不够稳定。真正短缺的往往不是更强的模型,而是能够持续、可信地供给AI的数据。

企业AI竞争正在从"模型能力竞争",转向"模型能力与数据供给能力的协同竞争"。以下从六个角度展开这一判断。

一、大模型很强,但企业的数据问题不会自动消失

模型可以理解和计算,但它至少有以下五件事解决不了。

第一,不能替企业确定指标的权威口径。"销售额"是含税还是不含税?"回款率"的分母是对账金额还是签约金额?模型不知道答案——这些定义需要业务和技术团队共同确认。

第二,不能自动判断哪套系统是可信数据源。同一个物料编码在ERP、MES、WMS中各不相同,模型无法判断以哪个为准。

第三,不能凭空补全缺失的业务术语和元数据。数据库字段叫"F_STAT_CD",模型不知道它代表"订单状态"还是"客户等级"——除非有人告诉它。

第四,不能保证源数据的准确、及时和完整。录入错误、同步延迟、字段缺失——这些是数据生产环节的问题,不在模型的能力范围内。

第五,不能代替企业制定数据权限和安全规则。谁能看什么数据、哪些字段不能展示给AI——这些是治理规则,不是模型推理。

一句话概括:模型可以生成答案,但数据治理决定这个答案是否建立在正确的数据、口径和权限之上。

二、三个趋势,让数据治理从外围工作进入AI核心链路

趋势一:AI进入核心业务,错误代价被放大。 当AI从"帮写周报"走向"帮做排产计划"和"帮评估供应商风险",数据错误的后果就从"报表数字对不上"变成了"生产、采购和风控决策出现偏差"。同样的数据问题,在BI报表时代是恼人,在AI决策时代是危险。

趋势二:高质量数据集从政策概念进入建设阶段。 2026年,江苏省共有147个项目入选高质量数据集建设先行先试名单,覆盖制造、医疗、交通等多个领域。数据供给正在从企业内部的一项IT工作,升级为有政策牵引和标准规范的基础设施工程。

趋势三:AI应用与数据治理形成双向循环。 这不是"先治理完再上AI"或"先上AI再补治理"的二选一。实践中的有效路径是:AI应用上线后,业务人员问出的"错误答案"往往恰好暴露了指标口径不一致、元数据标注缺失、数据时效不匹配等问题——这些信号反过来为治理工作提供了精准优先级。治理改善AI效果,AI暴露治理短板,两件事互相推动。

三、AI时代,治理发生了什么变化

AI没有让传统数据治理过时,但它深刻改变了治理的对象、要求和方式。

治理对象变了。 过去的数据治理主要面向结构化数据库中的表和字段。今天,企业的AI应用同时消费数据库、文档库、知识库、向量数据和训练推理数据集。治理的范围不再局限于"那张表",而是覆盖了AI消费数据的所有入口。

治理要求变了。 过去的数据质量目标是"字段正确、报表一致"。今天的标准升级为"机器可理解、语义可映射、结果可解释"。数据不仅要准确,还需要被AI正确地找到、正确地理解、正确地引用——这对元数据、业务术语和指标口径提出了远高于传统BI时代的精细度要求。

治理方式变了。 过去的数据治理通常以项目制推进——立项、实施、验收、结项。但在AI持续迭代的场景中,数据、模型和业务需求都在不断地变化。治理需要从阶段性项目升级为随数据、模型和业务场景持续迭代的闭环运营。

四、企业需要升级哪些治理能力

面向AI场景,企业可以从六个维度审视自身的数据治理准备度。

数据准确。 源数据真实、完整、符合业务规则。如果源表数据本身有误,AI给出的答案从一开始就是错的。

口径统一。 核心指标拥有唯一或明确适用范围的定义。"销售额"到底含不含税、"准时交付率"按哪个时间节点计算——这些定义需要跨部门达成共识并落地到系统中。

语义完整。 字段、表、指标和业务术语之间能够正确映射。业务人员说"帮我看下回款情况",AI需要知道去哪张表的哪个字段查什么算——这中间的所有映射关系都是治理需要沉淀的资产。

时效可控。 明确每个数据集的更新频率和可用时间范围。财务以月结为准,生产需要实时——AI需要知道"最新的数据"对不同场景意味着什么。

全程可追溯。 AI给出的每一个数据结论,应能追溯到数据源、加工过程和数据版本。当业务人员质疑"这个数为什么和财务对不上",追溯能力就是排查的起点。

安全可控。 AI只能访问和展示当前用户获得授权的数据,既不能因权限范围不足导致答案失真,也不能越权展示敏感字段。

AI数据供给能力六维雷达图

五、沿着"理采存管用"建设AI数据供给能力

以上六个维度不是彼此孤立的检查项。龙石数据在实践中提炼的"理、采、存、管、用"五阶段方法论,为面向AI的数据供给能力建设提供了一条可操作的实施路径。

在"理"阶段,明确AI应用场景,盘点和梳理涉及的数据资产、业务术语和核心指标口径——先搞清楚"AI需要什么数据、这些数据在哪、怎么定义的"。

在"采"阶段,将ERP、MES、CRM、文档库等多源异构数据接入统一的数据底座,解决"数据散落在哪"的问题。

在"存"阶段,对归集的数据进行清洗转换和编码统一,形成标准化的数据基础——这一步决定了后续AI消费的数据是否有统一的"语言"。

在"管"阶段,系统性地开展数据标准、元数据管理、质量检测、安全脱敏、血缘追踪和权限控制——六个维度中的大多数能力在这一阶段集中落地。

在"用"阶段,将治理成果以数据集、API、知识库和智能问数服务的形式发布和交付,让AI真正消费到经过治理的可信数据。

龙石数据中台按照这一链路,将数据盘点、归集、标准、元数据、质量、安全和数据服务连接起来,为AI应用持续提供可信、可理解、可追溯的数据供给。

六、企业从哪里开始

不必追求一步到位地完成全公司范围的数据治理,更务实的方式是"选场景、盘数据、跑闭环"。

先选择一个价值明确、数据边界清晰的AI应用场景——例如智能问数中的"经营分析"场景或"客户回款"场景。然后盘点该场景涉及的数据源、核心指标、业务术语和已知的质量问题。最后打通一条从"治理→应用→反馈→再治理"的小闭环,验证效果后再逐步扩展到更多场景。

这个闭环的核心价值在于:它让治理的优先级由真实的AI应用需求驱动,而不是由治理团队凭经验排期。当业务人员在AI问数中发现"这个指标口径不对"时,治理团队就有了明确的下一个工作目标。

FAQ

Q1:模型能力一直在提升,数据治理的投入会不会过时?

不会。模型提升的是"怎么算",数据治理解决的是"算什么、算哪个"——两个问题的性质不同。模型越强,越需要准确、一致、可理解的数据输入,否则更强的推理能力只是把数据中的问题放大得更快。从行业实践来看,数据治理不是AI热潮中的过渡性投入,而是AI能力持续发挥价值的基础条件。

Q2:是不是必须先完成全公司的数据治理,才能上AI应用?

不必。全公司范围的治理工程周期长、投入大,容易在治理完成前AI项目就失去了业务窗口。比较务实的策略是从一两个核心AI场景切入,先治理场景涉及的数据范围,跑通小闭环后再扩展。AI应用本身也会反向暴露治理问题,为后续的治理规划提供真实需求优先级。

Q3:企业想快速判断自己的数据能否支撑AI,可以先检查什么?

可以从六个问题入手:数据在哪些系统中、核心指标口径是否统一、关键字段能否被业务人员理解、数据质量是否做过基线评估、数据更新周期是否符合AI应用场景的要求、不同岗位的数据权限是否清晰。这六个问题不需要完美答案,但至少能让企业清楚自己和"AI就绪"之间的距离有多远。

参考来源

 

[1] 江苏网信办,《2026年江苏省高质量数据集建设先行先试项目入选名单》

[2] Andrew Ng, Data-Centric AI — 业界关于AI开发中数据准备重要性的广泛讨论

[3] GB/T 36073-2025《数据管理能力成熟度评估模型》(DCMM 2.0),全国信息技术标准化技术委员会

[4] 龙石数据,数据中台,https://www.longshidata.com/products/government.html

400-800-9577 400-800-9577
产品
解决方案
典型案例
赋能体系
视频和资源
微信咨询
微信咨询
苏州龙石信息科技有限公司微信公众号
电话咨询
电话咨询
400-800-9577
预约演示
预约演示
资料下载
资料下载
预约演示
资料下载

立即申请免费试用,开启数据治理之旅

预约演示
视频介绍
免费咨询