+86 +86 176 4317 7293

深圳市南山区科技园北区195座

随时致电 +86 +86 176 4317 7293
服务时间 每日 8:30-21:30(含法定节假日)

先聊一个我近年频繁碰到的情形。

一家公司投入数百万做数据治理。标准搭建了、平台部署了、历史数据也清理了一遍。验收会上演示材料很出色:数据完整度从62%提升到96%,一致性从71%提升到94%,还额外获得了一项行业认可。

半年后回访时,业务团队的反馈是:“数据依然不靠谱,我们继续自己用Excel处理。”

症结在哪里?

如果单看质量指标,这个项目算是成功的。但换个角度观察就会发现——那些清洁的数据,存放在数据仓库的第三层。业务部门要获取它,需要提交申请、等待安排、通过两个部门的审批。等数据到手,那场活动早就结束了。

质量达标,但距离太远,时机也已错失。三个因素里,只有一个被认真考量过。

数据的价值,从来不是数据本身天然具备的特性。

它由质量、距离、时间三个因素共同决定。我把支配这些因素的规则,称为数据的三大定律。

一、数据惯性定律:质量责任只能落在源头

你是否思考过:你现在处理的数据,早已不是最初的数据了。

给数据加上版本、加上时效、加上生命周期,你会发现它会老化、会分散、会被复制、会被修改。一份数据从产生那刻起,只要开始流动,它就不再是原来的它了。

这就是数据惯性定律:低质量的数据一旦进入流转过程,它所造成的影响无法回溯,也无法规避。后续无论怎么清洗、怎么建模,都是在为最初的那次“疏忽”反复付出代价。

我常把数据质量比作生育。生产时多花些精力,得到一个健康的个体,远比出生后再一点点修补要划算得多。

用公式表达,质量变量Q ∈ [0, 1],它衡量的是数据**“初始即健康”**的程度。注意它的特性:源头污染是不可逆的损耗。这是一个只能向下、很难向上的变量。

这条定律打破的误区是:“事后能清理干净”。

典型表现很容易识别——同一个字段反复清洗,始终无法彻底清除;每次治理项目结束,半年后问题再次出现。因为污染根源没有改变,你只是在后续环节不断稀释。

行动方向:将治理工作前置到业务源头,而不是前置到数据入库那一刻。 字段在哪个系统里首次被录入,治理就应该发生在那里。

二、数据互斥定律:通用性和价值,天然冲突

数据越集中越有价值?

恰恰相反——离业务越远,它就越没价值。

数据每远离业务现场一层,价值就减少一次。用公式表达是V(d) = V₀ · e^(−λd):V₀ 是数据在业务现场产生时的价值,d是距业务现场的层级数(业务系统 → 采集 → 清洗 → 建模 → 报表 → 决策),λ是语境衰减系数。

为什么会衰减?因为通用性和价值,天然冲突。

你把它抽取得越干净、越通用,它赖以体现价值的业务语境,就丢失得越多。等到它被抽象到完全脱离业务语境时,保留下来的是形式,流失掉的是内涵。

这条定律有四条推论,每一条都能在企业中找到对应实例。

推论一,中台悖论。 数据中台为复用而设计,但复用度最高的那一层,单点价值最低。这是它的设计目标决定的,不是执行不到位。

推论二,口径僵化。 离业务越远的口径,越没人敢修改,也越没人敢使用。最后变成一份谁都能背诵、但谁都不相信的数字。

推论三,成本放大。 在下游补救数据质量的成本,等于在上游节省的成本乘以经过的环节数。这和第一条定律是同一问题的两面。

推论四,最后一公里。 数据九成的价值,只产生在回到业务动作的最后那一公里。

行动方向:把指标定义权归还给业务。 不是让业务来审核 IT 的指标,而是让业务自己定义、自己修改、自己承担责任。

三、数据的时间价值定律:两个黄金期,中间是断层带

数据越新越有价值?

不对。它实际上有两个黄金期。

公式是V(t) = A · e^(−αt) + B · (1 − e^(−βt)),两项相加,形成双峰。

第一个高峰在产生的时刻——那时它还能影响结果。决策窗口一关闭,价值急剧下降,α 是业务节奏,节奏越快,下降越猛。一个实时风控模型,如果算出结果时交易已经完成,它的准确度再高也没有意义。

第二个高峰在足够久之后——当你积累足够长的历史,它就能再次用于建模、归因、判断趋势,价值二次上升。β 是历史厚度,厚到什么程度能释放价值,取决于你要回答的问题。

麻烦的是中间那段。既不新鲜,也不够老——这就是价值的断层带。

多数企业的数据仓库里,80% 的存储成本,压在这段价值最低的数据上。

这是最常见、也最不易被察觉的一种浪费。

还有一条容易被忽略的推论,我称它为连续性溢价:历史数据的价值在于“连续”。断掉一年的历史,损失远不止 1/N,因为规律推断直接失效——你无法用一份有缺口的时间序列去判断周期。

行动方向:分层存储不应只按“访问频率”设计,应该按时间价值曲线设计。 另外三件事现在就能做:实时化投入先看决策窗口有多长,只有窗口以分钟计的业务才值得做秒级链路;归档策略要保留一条低成本但可回热的恢复通道;不要为了节省存储费用删除历史数据,那是最昂贵的一种省钱方式。

四、为什么必须是乘法:这是整套内容里最重要的一句

把三条定律结合起来,数据的价值函数是这样的:

V = Q × D × T

展开写是V(d, t) = Q · V₀ · e^(−λd) · [A·e^(−αt) + B·(1−e^(−βt))]。

请注意中间那个符号:是乘号,不是加号。这一点至关重要。

如果是加法,你可以用一项的长处去弥补另一项的短处。但乘法不行。

质量再好,离业务太远,价值仍趋近于零——一份完美清洁、却存放在数据仓库三层之外的表,没人使用,价值就是零。距离再近,过了决策窗口,价值归零——实时计算再准确,等你算出来,活动已经结束。既不脏也不远,但卡在断层带,价值最低——这条最隐蔽,也最耗费成本。

由此得出一个不太舒适的推论:数据治理不能“单点突破”。

很多团队的失败就在这里。他们把质量治理做到了 90 分,但数据离业务三个层级,Q = 0.9,D = 0.1,乘出来只有 0.09。投入产出比极差,然后得出“数据治理没用”的结论。

这其实是最小因子定律(李比希定律)在数据领域的映射:三个变量里最低的那一个,决定了整体价值的上限。往另外两个变量上投入资源,天花板不会改变。

五、怎么用:先诊断,再投入

四条实操建议,按顺序执行。

第一,先诊断,别先立项。 把Q / D / T三个变量分别打分,找出你团队当前最低的那一个。这一步花不了两周,但能省掉一年的预算。

第二,最低的那个,就是当下唯一值得投入的方向。 不是“重点投入”,是“唯一”。其他两个维持不恶化就行。

第三,不要三个变量同时铺开做。 那等于把预算分散在三张桌子上,每张桌子都不够用。

第四,每半年重新诊断一次。 因为最低的那个会变化。质量补上来之后,距离往往就变成了新的瓶颈——这其实是好事,说明前一阶段做对了。

三条定律速查,建议保存下来:

最后的话

讲了三条定律,其实说的是同一件事:数据的价值,从来不是它本身固有的。

它是质量、距离、时间三个变量的函数。而治理的全部工作,就是让这三个变量同时朝有利的方向移动。

回到开头那家企业。它的问题不在于不愿投入,而在于只投了三个变量中的一个,然后期待整体价值翻三倍。乘法世界里没有这种好事。

所以下次再有人问“数据治理到底有没有用”,我建议先反问一句:你团队现在最低的那个变量,是哪个?

答不上来,说明还没开始。

你所在的团队,三个变量里最低的是哪一个?评论区聊聊。

附一句:这三条定律,我各录了一条 40 秒左右的口播版,已经发在视频号上了。想先快速过一遍的,可以去那边听;想看推导和落地动作的,这篇里都有。

本文来自微信公众号“数据驱动智能”(ID:Data_0101),作者:王建峰,36氪经授权发布。

56,856

客户

56,856

评论

251

团队成员

50%

想了解更多客服团队实时更新解答,确保信息与最新版本同步。相关内容,尽在使用帮助。

贡献

数据的三大定律:价值从来不是数据本身固有的 - 账号登录

使用帮助围绕爱游戏网页版不断创新,回应用户的真实需求。

精选账号登录内容,使用帮助与你一同发现更多精彩。

围绕常见问题,使用帮助持续打磨更优质的服务。

使用帮助专注使用帮助,为用户提供专业可靠的体验。

围绕常见问题,使用帮助持续打磨更优质的服务。

使用帮助深耕登录步骤以图文分步展示,降低操作门槛。领域,用心服务每一位用户。

在密码找回流程全程引导,平均3分钟内完成重置。方面,使用帮助提供贴心周到的支持。

使用帮助以常见问题覆盖90%以上账号相关疑问。为核心,带来高效便捷的体验。

想了解更多客服团队实时更新解答,确保信息与最新版本同步。相关内容,尽在使用帮助。

使用帮助围绕爱游戏网页版不断创新,回应用户的真实需求。

使用帮助围绕爱游戏网页版不断创新,回应用户的真实需求。

围绕常见问题,使用帮助持续打磨更优质的服务。

精选账号登录内容,使用帮助与你一同发现更多精彩。

使用帮助专注使用帮助,为用户提供专业可靠的体验。

围绕常见问题,使用帮助持续打磨更优质的服务。