别急着上模型:先做一次五分钟的数据体检
决定一个建模项目成败的,八成在数据这一关。这五个问题问完,就知道能不能往下走。
我们接项目前一定会做一次数据体检。不看真实数据,只问五个问题,通常十几分钟就能判断这件事能不能做、要做多久。这五个问题你自己也可以先问一遍,能省下不少沟通成本。
一、粒度:数据记到多细
这是最致命的一条。想给每家门店每个单品定备货量,数据就必须细到“门店 × 单品 × 日”;如果系统里只有“门店 × 日”的总营业额,那再多年份也算不出单品备货。粒度不够不是清洗能解决的问题,它是信息本身不存在。
反过来也要注意:粒度过细但字段缺失同样麻烦。比如有每一笔订单,却没记录订单属于哪个门店的哪个渠道,那渠道差异就分析不了。
二、跨度:覆盖了几个完整周期
餐饮零售有很强的季节性和节假日效应。只有 6 个月数据,模型没见过春节、没见过暑期,就无法把这些因素和普通波动区分开。我们的经验门槛是:预测类项目至少 18 个月,最好 24 个月;选址类项目至少 12 个月且要覆盖淡旺季。
另外要问一句:这段时间里有没有发生过结构性变化——大规模改版菜单、外卖占比翻倍、疫情期间的异常。有变化不一定不能做,但要在建模时显式处理,不能装作没发生。
三、变异:你想问的那个变量,变过没有
想知道降价会怎样,历史上就得调过价;想知道新装修能带来多少提升,就得有装修前后的对比门店。数据里没有变化,就没有可供学习的信号——这时候正确的做法是先设计一次小范围试验去制造变化,而不是硬算一个没有依据的弹性。
四、口径:同一个字段,各部门说的是不是一回事
“营业额”是否含税、是否扣掉退单、外卖平台佣金算在哪一边,财务、运营和 IT 给的口径经常不一样。这类问题不解决,模型算得再精细,结论也会在汇报会上被一句“这个数跟我们财务的对不上”打回来。
我们会在项目一开始就要一份字段说明,并且拿一两个月的数据和你们财务报表对一次账。这一步看着琐碎,但它决定了结论最后能不能被采信。
五、可得性:拿数据要走多久流程
技术上没难度,但实际项目里最常拖期的就是这一环:数据在第三方 SaaS 里、导出要走审批、每次只能导一个月。开工前把”谁来导、多久导一次、什么格式“敲定,比事后催三次有用。
体检不合格怎么办
- 粒度不够——先改数据采集,哪怕只是让门店多记一个字段,三个月后再来算;
- 跨度不够——先做描述性分析和规则版方案,等数据攒够再上模型;
- 没有变异——设计一次小范围试验,用两三个月拿到可用的对比数据;
- 口径不清——先花一周对齐口径,这一周省不掉,早对晚对都得对。
这些替代方案通常比硬做一个模型便宜得多。我们宁可这次少接一个项目,也不想交付一份自己都不敢背书的结论。