选址模型里最容易骗人的三个假设
选址模型算出来的分数很有说服力,但分数背后的假设经常经不起推敲。
选址是最适合建模的场景之一:决策贵、可重复、有数据。但也正因为结果是一个具体分数,特别容易让人忘记它建立在什么假设上。下面三个是我们踩过、也见别人踩过最多的。
假设一:新店的表现规律和老店一样
几乎所有选址模型都是用现有门店的数据训练的——用它们的位置特征去解释它们的营业额,再把这套关系套到候选点位上。这里藏着一个幸存者偏差:你现在还开着的门店,本来就是当年选址决策的“成功样本”。关掉的、从没开成的点位不在数据里,模型看不见失败长什么样。
缓解办法有两个:一是尽可能把已关闭门店的历史数据找回来,哪怕不全;二是别让模型只输出一个预测值,而要输出“这个点位与训练数据的相似程度”。落在数据覆盖范围之外的候选点,分数再高也要打问号。
假设二:新店的生意都是增量
模型算出候选点位年营业额 400 万,管理层就当成净增 400 万。但如果这个点离现有门店只有 800 米,其中可能有一半是从老店身上转移过来的。不做自蚕食测算的选址结论,会系统性高估扩张收益——门店数涨了,单店营业额却在跌,这是连锁扩张最常见的坑。
做法上,需要在模型里显式加入“与既有门店的距离/重叠商圈”这类变量,并单独输出一张“新店对周边老店的影响”测算表。我们的交付里这是必须项,因为它经常是决策反转的关键:某个点位单看很好,算完蚕食就不划算了。
假设三:人流等于生意
人流数据(尤其是买来的第三方热力数据)看起来客观,但它衡量的是“经过的人”,不是“会进来消费的人”。写字楼下的人流在工作日中午集中爆发、晚上和周末归零;地铁口的人流大部分是快速通过的。同样的人流数值,对快餐、咖啡、正餐的意义完全不同。
更可靠的做法是用你自己的数据去校准:把现有门店的实到客数与各类人流指标做拟合,看哪一类人流对你的业态真正有解释力。经常会发现某个花钱买来的指标,在你的业态里解释力接近于零——那这笔数据钱就该省下来。
所以一份靠谱的选址报告应该长什么样
- 给的是区间而不是单点值,并标注每个点位的“外推风险”
- 有独立的自蚕食测算,说明新店会从哪几家老店分走多少
- 说明每个变量的解释力,而不是只给一个综合分
- 做过敏感性分析:租金涨 20%、客流下降 15% 时,排序会不会翻转
- 写明模型在什么条件下失效——比如“本模型不适用于机场、景区等强流动性商圈”
如果一份选址报告只有一张点位排名表和一个漂亮的分数,那它更像销售材料,不像分析结论。