社区 发现 AI AI和亚马逊-我用WorkBuddy手搓...
AI和亚马逊-我用WorkBuddy手搓了一个亚马逊分时广告诊断台
你打开广告后台的小时报表,看到凌晨 3 点 ACOS 冲到 300%,晚上 8 点只有 20%。于是你心里有数了:凌晨降价,晚上加价,把预算从低效时段搬到高效时段。
这个动作看起来天经地义,几乎所有分时优化的教程都这么教。
但如果我告诉你,在你常见的账户量级下,这样的判断有接近一半的概率是错的——你调的不是"低效时段",而是"这周恰好没出单的时段"呢?
这不是危言耸听,是我拿一份真实账户数据算出来的结果。
一次统计体检
先交代这份数据的基本面(已脱敏):
半标品类目,中小卖家账户
14 天,33 个投放中的广告活动
有效点击 701 次,订单 111 单
整体 CVR 15.83%,ACOS 112.3%,客单价 $14.49
按最常见的做法,把它切成 3 小时一段,得到 8 个时段:
看到 03:00-06:00 的 137% 了吗?看到 12:00-15:00 的 78% 了吗?
常规做法会让你给前者加价、给后者降价。
但这两个数字,经不起一次统计检验。
问题出在哪:你的样本比你以为的小得多
很多人有个错觉:14 天 × 24 小时 = 336 个数据点,样本够多了。
错。336 是格子数,不是样本量。
真实的样本量是:每个小时格子,14 天里只有14 个小时的数据。切 3 小时一段,每段 42 个小时,累计88 次点击。
88 次点击能说明什么?
整体 CVR 是 15.83%,在 88 个样本下,标准误是 3.9 个百分点。换算成 95% 置信区间:
一个真实 CVR 就是 15.83% 的普通时段,它的观测值有 95% 的概率落在 8.2% ~ 23.5% 之间。
而 03:00-06:00 观测到的 21.6%,12:00-15:00 观测到的 12.4%——全在这个区间里。
换句话说:即使这个账户所有时段的真实转化率一模一样,你照样会看到有的时段 21%、有的时段 12%。这不是规律,这是抽奖。
我算了一下误判概率:在 88 次点击、整体 CVR 15.83% 的条件下,一个完全没有差异的时段——
有 21.7% 的概率被误判为"优异"
有 24.9% 的概率被误判为"差"
合计误判率 46.6%
8 个时段里,大约3.7 个是纯噪音产生的假信号。
你按这个调价,等于每周换一次策略去追逐随机波动。效果能好才怪。
还有个更隐蔽的坑:多重比较
你可能会说:那我做个显著性检验不就行了?
行,但要注意一个陷阱。
我给这 24 个时段(1 小时粒度)逐个做了二项检验,结果是:有1 个时段 p<0.05,看起来"显著"。
但当你做 24 次检验时,即使数据全是噪音,期望也会出现24 × 0.05 = 1.2 个"显著"结果。
这就是多重比较问题。把那个 p=0.023 的时段做 Bonferroni 校正(乘以段数):
p = 0.55,完全不显著。
那个"显著差异",就是那 1.2 个期望中的假阳性之一。
所以正确的流程是:检验 + 校正,两步都得做。只做第一步,你只是把直觉误判换成了统计误判,本质没变。
那正确的判断框架是什么?
三层,顺序不能乱。
第一层:样本量闸门 —— 先问"我够不够格做这个判断"
在比较任何数字之前,先算清楚:以我目前的数据量,能分辨多大的差异?单时段所需点击数 n = (1.96 + 0.84)² × p(1−p) ÷ (p × 阈值)²(p = 整体 CVR,1.96 对应 95% 置信度,0.84 对应 80% 统计功效)
用上面那个账户算:
注意这是平方关系:阈值从 30% 收紧到 20%,需要的样本量翻 2.25 倍。
这张表应该成为你做分时优化前的第一件事——先确认自己有没有资格下结论。
第二层:统计检验 —— 确认差异是真的
对每个时段做二项检验(原假设:该时段 CVR 与整体相同),再做Bonferroni 校正(p × 段数)。
只有校正后 p < 0.15 的时段,才允许给它"优异"或"差"的判定。其余一律维持不动。
第三层:幅度判据 —— 决定加多少、减多少
这里有个容易踩的坑:主判据要用 CVR,不要用 CPA。
原因很直接:点击量远大于订单量,CVR 的标准误比 CPA 小一个量级。上面那份数据里,CPA 在时段间从 $8.86 跳到 $57.66 看起来触目惊心,但那些时段只有 2~5 单——分母太小,CPA 本身就不稳定。
竞价幅度建议用 CVR 偏离度驱动,同时用样本量自动约束幅度:竞价调整 = (相对CVR − 1) × 50% × min(1, 点击数 ÷ 150)样本越少,自动给的建议幅度越小。这是给不确定性上的一道保险。
关于"±20% 阈值"这个标准
有个卖家朋友给我提过一个判断标准,我觉得很有代表性:
以平均转化率为基准,高于 20% 算优异,低于 20% 算差,中间算正常波动。
框架完全正确——用 CVR 作主指标、用相对百分比而非绝对差值、三档结构清晰可执行。这三处都对。
但有个致命前提没满足:阈值必须大于噪音幅度。
计算公式:噪音幅度 RME = 1.96 × √(p(1−p) ÷ n) ÷ p还是那个账户,各粒度的噪音幅度(按样本最少的时段计算,比用平均值保守):
为什么按"最少"而不是"平均"?因为真实数据的各时段样本极不均匀——12 小时切 2 段时,两段是 197 和 504,平均 351 看着还行,但弱的那一半决定了你的判断下限。
噪音幅度 77%,你的阈值 20%——阈值比噪音还小。
这意味着你划的那条线,落在随机波动的内部。用它筛选出来的"优异时段",本质上是从噪音里挑出了这周运气好的那几个。
结论:±20% 作为业务目标是合理的(20% 的差异确实值得动),但在日均 50 点击的账户上,它现在还不成立。
要么放宽到 30%(8 段 61 天、日夜 2 段 5 天),要么先用日夜对比观察,要么老实积累数据。
那中小卖家就完全不能做分时了?
能做,但顺序要对。
第一步:先看整体投产,别急着分时。
那个账户 ACOS 112%,广告是亏的。这时候做分时优化,本质是把亏损在时段之间重新分配,改变不了总量。
先把 ACOS 200%~400% 的广告活动关停或大幅降竞价,这比任何分时调整都更能止血。
第二步:切更粗的粒度。
3 小时做不了,就做日夜对比(12 小时 2 段)。
还是这份数据,把判定标准放宽到±30%(对小账户来说这是更现实的选择),达成度会从 3 小时的19%提升到日夜对比的76%——粗糙但基本可信,远好过精细但全是噪音。
如果坚持 ±20%,日夜对比也只有 34%,还得再攒 28 天。这笔账你自己权衡。
第三步:合并多份报表,但一定要去重。
后台一次只能下 14 天,想攒数据就得下多份。这里有个隐蔽陷阱:
你下的 A(8/18-8/24)和 B(8/21-8/27),8/21~8/24 是重复的。直接拼接,这些天会被算两遍,数字全错。
正确做法:以「日期 + 小时 + 广告活动」为唯一键去重,重叠部分保留下载时间较晚的那份——因为订单用的是 7 天归因窗口,晚下载的报表近期数据更完整。
第四步:固定节奏,别频繁调整。
数据积累期间最忌讳的就是边跑边改。你每调一次价,之前的数据就"脏"了一部分,永远攒不够干净的样本。
一份可直接用的检查清单
做分时优化前,按顺序问自己:
整体 ACOS 达标了吗?没达标先处理结构问题
我的账户日均点击是多少?(注意是点击,不是展示)
按当前数据量,能识别多大的差异?(算 RME)
我设的阈值,大于噪音幅度吗?
粒度选对了吗?(数据少就用日夜对比)
时段差异通过显著性检验了吗?校正了吗?
合并多份报表时,重叠日期去重了吗?
单次调整幅度控制在多少?(建议 ≤20%,观察 7 天再复盘)
我们把这套逻辑做成了工具
上面这些计算——样本量测算、噪音幅度、二项检验、多重比较校正、多报表去重——手算一遍至少要一小时,还容易出错。
我们做成了「亚马逊分时广告诊断台」,打开传报表就行:
自动识别中文 / 英文 / 日文后台格式,多币种
顶部先给数据充足度诊断:达成度多少、还需积累几天、各粒度对比表
每个时段给出校正 p 值,不显著的一律不动
阈值体检:实时检查你设的阈值是否大于噪音幅度
支持一次合并多个 14 天报表,自动剔除重叠日期
一键生成判断报告,可存 PDF、导出 HTML、或复制纯文本发团队
在线地址(打开即用,不用装、不用注册):https://workbuddy.link/p/q0Jl9aIIinN5NLVnGUq0dl
数据全程在你自己浏览器里解析,不上传服务器。链接是公开的,但每个人看到的都是自己上传的数据。
想先看看效果,打开后点「载入示例」——里面有"数据不足的小账户"示例,就是照着本文这个真实账户的量级造的,能直观看到数据不够时工具会拒绝给建议。
最后说句实话
广告优化做到后面,真正拉开差距的往往不是"谁的动作更快",而是谁知道什么时候不该动手。
看到时段差异就调价,是一种勤奋。但在一个日均 50 点击的账户上,这种勤奋的期望收益是负的——你在系统性地对随机波动做反应。
成熟的标志之一,是能坦然说出"这份数据还不足以支撑判断",然后去把数据攒够。
毕竟,宁可不做,也不要错做。
















倒计时:
0 个回复