+86 +86 176 4317 7293
深圳市南山区科技园北区195座
先聊一个我近年频繁碰到的情形。
一家公司投入数百万做数据治理。标准搭建了、平台部署了、历史数据也清理了一遍。验收会上演示材料很出色:数据完整度从62%提升到96%,一致性从71%提升到94%,还额外获得了一项行业认可。
半年后回访时,业务团队的反馈是:“数据依然不靠谱,我们继续自己用Excel处理。”
症结在哪里?
如果单看质量指标,这个项目算是成功的。但换个角度观察就会发现——那些清洁的数据,存放在数据仓库的第三层。业务部门要获取它,需要提交申请、等待安排、通过两个部门的审批。等数据到手,那场活动早就结束了。
质量达标,但距离太远,时机也已错失。三个因素里,只有一个被认真考量过。
数据的价值,从来不是数据本身天然具备的特性。
它由质量、距离、时间三个因素共同决定。我把支配这些因素的规则,称为数据的三大定律。
你是否思考过:你现在处理的数据,早已不是最初的数据了。
给数据加上版本、加上时效、加上生命周期,你会发现它会老化、会分散、会被复制、会被修改。一份数据从产生那刻起,只要开始流动,它就不再是原来的它了。
这就是数据惯性定律:低质量的数据一旦进入流转过程,它所造成的影响无法回溯,也无法规避。后续无论怎么清洗、怎么建模,都是在为最初的那次“疏忽”反复付出代价。
我常把数据质量比作生育。生产时多花些精力,得到一个健康的个体,远比出生后再一点点修补要划算得多。
用公式表达,质量变量Q ∈ [0, 1],它衡量的是数据**“初始即健康”**的程度。注意它的特性:源头污染是不可逆的损耗。这是一个只能向下、很难向上的变量。
这条定律打破的误区是:“事后能清理干净”。
典型表现很容易识别——同一个字段反复清洗,始终无法彻底清除;每次治理项目结束,半年后问题再次出现。因为污染根源没有改变,你只是在后续环节不断稀释。
行动方向:将治理工作前置到业务源头,而不是前置到数据入库那一刻。 字段在哪个系统里首次被录入,治理就应该发生在那里。
数据越集中越有价值?
恰恰相反——离业务越远,它就越没价值。
数据每远离业务现场一层,价值就减少一次。用公式表达是V(d) = V₀ · e^(−λd):V₀ 是数据在业务现场产生时的价值,d是距业务现场的层级数(业务系统 → 采集 → 清洗 → 建模 → 报表 → 决策),λ是语境衰减系数。
为什么会衰减?因为通用性和价值,天然冲突。
你把它抽取得越干净、越通用,它赖以体现价值的业务语境,就丢失得越多。等到它被抽象到完全脱离业务语境时,保留下来的是形式,流失掉的是内涵。
这条定律有四条推论,每一条都能在企业中找到对应实例。
推论一,中台悖论。 数据中台为复用而设计,但复用度最高的那一层,单点价值最低。这是它的设计目标决定的,不是执行不到位。
推论二,口径僵化。 离业务越远的口径,越没人敢修改,也越没人敢使用。最后变成一份谁都能背诵、但谁都不相信的数字。
推论三,成本放大。 在下游补救数据质量的成本,等于在上游节省的成本乘以经过的环节数。这和第一条定律是同一问题的两面。
推论四,最后一公里。 数据九成的价值,只产生在回到业务动作的最后那一公里。
行动方向:把指标定义权归还给业务。 不是让业务来审核 IT 的指标,而是让业务自己定义、自己修改、自己承担责任。
数据越新越有价值?
不对。它实际上有两个黄金期。
公式是V(t) = A · e^(−αt) + B · (1 − e^(−βt)),两项相加,形成双峰。
第一个高峰在产生的时刻——那时它还能影响结果。决策窗口一关闭,价值急剧下降,α 是业务节奏,节奏越快,下降越猛。一个实时风控模型,如果算出结果时交易已经完成,它的准确度再高也没有意义。
第二个高峰在足够久之后——当你积累足够长的历史,它就能再次用于建模、归因、判断趋势,价值二次上升。β 是历史厚度,厚到什么程度能释放价值,取决于你要回答的问题。
麻烦的是中间那段。既不新鲜,也不够老——这就是价值的断层带。
多数企业的数据仓库里,80% 的存储成本,压在这段价值最低的数据上。
这是最常见、也最不易被察觉的一种浪费。
还有一条容易被忽略的推论,我称它为连续性溢价:历史数据的价值在于“连续”。断掉一年的历史,损失远不止 1/N,因为规律推断直接失效——你无法用一份有缺口的时间序列去判断周期。
行动方向:分层存储不应只按“访问频率”设计,应该按时间价值曲线设计。 另外三件事现在就能做:实时化投入先看决策窗口有多长,只有窗口以分钟计的业务才值得做秒级链路;归档策略要保留一条低成本但可回热的恢复通道;不要为了节省存储费用删除历史数据,那是最昂贵的一种省钱方式。
把三条定律结合起来,数据的价值函数是这样的:
V = Q × D × T
展开写是V(d, t) = Q · V₀ · e^(−λd) · [A·e^(−αt) + B·(1−e^(−βt))]。
请注意中间那个符号:是乘号,不是加号。这一点至关重要。
如果是加法,你可以用一项的长处去弥补另一项的短处。但乘法不行。
质量再好,离业务太远,价值仍趋近于零——一份完美清洁、却存放在数据仓库三层之外的表,没人使用,价值就是零。距离再近,过了决策窗口,价值归零——实时计算再准确,等你算出来,活动已经结束。既不脏也不远,但卡在断层带,价值最低——这条最隐蔽,也最耗费成本。
由此得出一个不太舒适的推论:数据治理不能“单点突破”。
很多团队的失败就在这里。他们把质量治理做到了 90 分,但数据离业务三个层级,Q = 0.9,D = 0.1,乘出来只有 0.09。投入产出比极差,然后得出“数据治理没用”的结论。
这其实是最小因子定律(李比希定律)在数据领域的映射:三个变量里最低的那一个,决定了整体价值的上限。往另外两个变量上投入资源,天花板不会改变。
四条实操建议,按顺序执行。
第一,先诊断,别先立项。 把Q / D / T三个变量分别打分,找出你团队当前最低的那一个。这一步花不了两周,但能省掉一年的预算。
第二,最低的那个,就是当下唯一值得投入的方向。 不是“重点投入”,是“唯一”。其他两个维持不恶化就行。
第三,不要三个变量同时铺开做。 那等于把预算分散在三张桌子上,每张桌子都不够用。
第四,每半年重新诊断一次。 因为最低的那个会变化。质量补上来之后,距离往往就变成了新的瓶颈——这其实是好事,说明前一阶段做对了。
三条定律速查,建议保存下来:
讲了三条定律,其实说的是同一件事:数据的价值,从来不是它本身固有的。
它是质量、距离、时间三个变量的函数。而治理的全部工作,就是让这三个变量同时朝有利的方向移动。
回到开头那家企业。它的问题不在于不愿投入,而在于只投了三个变量中的一个,然后期待整体价值翻三倍。乘法世界里没有这种好事。
所以下次再有人问“数据治理到底有没有用”,我建议先反问一句:你团队现在最低的那个变量,是哪个?
答不上来,说明还没开始。
你所在的团队,三个变量里最低的是哪一个?评论区聊聊。
附一句:这三条定律,我各录了一条 40 秒左右的口播版,已经发在视频号上了。想先快速过一遍的,可以去那边听;想看推导和落地动作的,这篇里都有。
本文来自微信公众号“数据驱动智能”(ID:Data_0101),作者:王建峰,36氪经授权发布。
客户
评论
团队成员
想了解更多客服团队实时更新解答,确保信息与最新版本同步。相关内容,尽在使用帮助。
使用帮助围绕爱游戏网页版不断创新,回应用户的真实需求。
围绕常见问题,使用帮助持续打磨更优质的服务。
使用帮助专注使用帮助,为用户提供专业可靠的体验。
在密码找回流程全程引导,平均3分钟内完成重置。方面,使用帮助提供贴心周到的支持。
使用帮助围绕爱游戏网页版不断创新,回应用户的真实需求。
精选账号登录内容,使用帮助与你一同发现更多精彩。