数据 · 2026-05-18 · 6 分钟

别急着上模型:先做一次五分钟的数据体检

决定一个建模项目成败的,八成在数据这一关。这五个问题问完,就知道能不能往下走。

我们接项目前一定会做一次数据体检。不看真实数据,只问五个问题,通常十几分钟就能判断这件事能不能做、要做多久。这五个问题你自己也可以先问一遍,能省下不少沟通成本。

一、粒度:数据记到多细

这是最致命的一条。想给每家门店每个单品定备货量,数据就必须细到“门店 × 单品 × 日”;如果系统里只有“门店 × 日”的总营业额,那再多年份也算不出单品备货。粒度不够不是清洗能解决的问题,它是信息本身不存在。

反过来也要注意:粒度过细但字段缺失同样麻烦。比如有每一笔订单,却没记录订单属于哪个门店的哪个渠道,那渠道差异就分析不了。

二、跨度:覆盖了几个完整周期

餐饮零售有很强的季节性和节假日效应。只有 6 个月数据,模型没见过春节、没见过暑期,就无法把这些因素和普通波动区分开。我们的经验门槛是:预测类项目至少 18 个月,最好 24 个月;选址类项目至少 12 个月且要覆盖淡旺季。

另外要问一句:这段时间里有没有发生过结构性变化——大规模改版菜单、外卖占比翻倍、疫情期间的异常。有变化不一定不能做,但要在建模时显式处理,不能装作没发生。

三、变异:你想问的那个变量,变过没有

想知道降价会怎样,历史上就得调过价;想知道新装修能带来多少提升,就得有装修前后的对比门店。数据里没有变化,就没有可供学习的信号——这时候正确的做法是先设计一次小范围试验去制造变化,而不是硬算一个没有依据的弹性。

四、口径:同一个字段,各部门说的是不是一回事

“营业额”是否含税、是否扣掉退单、外卖平台佣金算在哪一边,财务、运营和 IT 给的口径经常不一样。这类问题不解决,模型算得再精细,结论也会在汇报会上被一句“这个数跟我们财务的对不上”打回来。

我们会在项目一开始就要一份字段说明,并且拿一两个月的数据和你们财务报表对一次账。这一步看着琐碎,但它决定了结论最后能不能被采信。

五、可得性:拿数据要走多久流程

技术上没难度,但实际项目里最常拖期的就是这一环:数据在第三方 SaaS 里、导出要走审批、每次只能导一个月。开工前把”谁来导、多久导一次、什么格式“敲定,比事后催三次有用。

体检不合格怎么办

  • 粒度不够——先改数据采集,哪怕只是让门店多记一个字段,三个月后再来算;
  • 跨度不够——先做描述性分析和规则版方案,等数据攒够再上模型;
  • 没有变异——设计一次小范围试验,用两三个月拿到可用的对比数据;
  • 口径不清——先花一周对齐口径,这一周省不掉,早对晚对都得对。

这些替代方案通常比硬做一个模型便宜得多。我们宁可这次少接一个项目,也不想交付一份自己都不敢背书的结论。

遇到类似的问题?
先聊 30 分钟,我们直接告诉你值不值得做。
聊聊你的场景 →
免费资料
门店数据体检清单

五个问题问完,就知道手上的数据能不能支撑想要的结论。A4 单页,可直接打印。

不做群发、不给第三方。也可以 直接下载 →

门店数据体检清单封面