广告创意测试:没人算过的那笔产能账
先看这个决定付费投放成败的数字:只有大约 6% 到 7% 的广告变体能真正跑出量。 也就是说,你做 100 条广告,大约 93 条永远不会拿到有意义的预算。 这一个事实就改写了整件事。既然赢家稀少且不可预测,那么最高杠杆的变量就不是 "每条广告的平均质量",而是**你能往竞价里放进多少条真正不同的变体**。 测 3 到 5 条,期望值是零个赢家;测 50 到 80 条,才能稳定找出 3 到 5 个。 所以真正的约束不是测不测,而是**产能 —— 多做一条变体要花多少钱**。 这一点几乎没有人算过,而它决定了"创意测试"是一个真实运转的项目,还是只活在提案里。
作者:Elias Sun,BrandU 创始人
六件事,共用一个名字
"广告创意测试"这句话,是六件事共用一个名字。而其中只有一件,决定了另外五件有没有东西可做。
最后一行,是另外五件一直默默依赖的那件。如果你手上只有两条广告可测, 上面所有测量方法都等于零 —— 而这恰恰是大多数团队的真实处境。
| 你想知道 | 这件事 | 它能证明 | 它不能证明 |
|---|---|---|---|
| 花钱前,人能不能看懂或偏好它? | 上线前预测 | 概念对样本是否清晰 | 它在真实竞价里的表现 |
| 有人会注意到品牌吗? | 注意力测量 | 品牌与信息是否被看见 | 它是否转化 |
| 哪个元素(钩子/图/优惠)在起作用? | 多元素测试 | 哪个元素推动了指标 | 整个概念对不对 |
| 正在跑的广告,结果怎么解释? | 创意分析 | 已有结果背后的规律 | 因果关系 |
| 这次改动是否带来了提升? | 平台内实验 | 平台内的因果 | 平台外的任何事 |
| 我们到底有没有足够多变体可测? | 产能 | 你能投放多少条真正不同的变体 | 其中任何一条会不会赢 |
一个低命中率的算式
按 6.5% 的命中率,期望赢家数不是品味问题,是一道算式:
再看第一行。大多数团队每次测 3 到 5 条 —— 恰好是期望值不足一个赢家的那一行。 那些测试里没有失败,只是样本太小,稀有的赢家根本没有浮现的机会。
原因不是创意质量,是竞价动态:平台会把曝光集中在早期有互动和转化信号的变体上, 把其余的饿死。少数创意吃掉有效的预算,长尾拿不到真实的曝光量。
| 测的变体 | 期望赢家 | 实际意味着什么 |
|---|---|---|
| 3–5 | ~0(不到 0.4) | 连找到一条都是抛硬币。最常见的失败模式。 |
| 15 | ~1 | 最小可用的测试。运气好有一条。 |
| 30 | ~2 | 一个可靠项目的起点。 |
| 50 | ~3 | 能稳定浮现出一个小赢家集。 |
| 80 | ~5 | 一个放量账户的月度目标。 |
| 100+ | ~6–7 | 高预算、多市场项目。 |
一个人人都给的忠告,和它为什么落不了地
"多做一些创意"不是有争议的建议。每个平台都这么说,每家代理商都重复它, 每个投放操盘手都同意。所以有意思的问题不是"量重不重要", 而是:**为什么有预算、有简报、也有意愿的团队,最后还是只投了四条,而不是八十条?**
答案是成本结构,而且是算术,不是纪律问题。
在传统的制作模式里,一条广告就是完整跑一遍流水线:写脚本、生成、配音、渲染 —— 每次都从头来。这个模式让第 10 条变体的成本,和第 1 条**完全一样**。 于是产能的上限不是团队想做多少条,而是预算能按全价吃下多少条。 在那个价格上,80 条不是一个工作流,是一个季度的战役。
这就是那个没人点名的约束。团队把它描述成创意问题 —— "我们拍不起更多了"、"代理商要更多预算"、"我们只有四个值得测的概念" —— 但它其实是一个流水线问题,穿了件创意问题的外衣。
什么算一条新创意 —— 按平台自己的说法
大多数"上量"策略都是在这里悄悄失败的:**产出 80 个文件,不等于产出 80 条广告。**
关于排序引擎怎么读取创意,Meta 对广告主的口径是明确的,而且比大多数团队以为的更严。 据经 Meta 沟通的代理商高管转述:如果一条广告与该广告主其他素材长得一样、 或者开头钩子一样,引擎就不会给它同样高的排名 —— **系统会认为它们本质上是同一条广告。** 同一个人、同一段素材、只是屏幕文字不同,**仍然算一条创意,不是两条。**
Meta 自己的发言人也把这套口径描述成刻意"以结果为准、而非针对某一模型": **多样化你的创意、去测、然后让系统优化。** Google 公开的指引指向同一方向 —— App 广告系列建议**填满每一个可用的素材位**, 每个广告组最多 10 条文本、20 张图片、20 条视频;它 Performance Max 的资源组指引 同样是围绕"多样化"构建的。
所以,真正能产生"一条新创意"的轴,是那些**改变论证本身**的轴: 钩子、开头几秒、切入角度、形式、面向特定人群的说法。 颜色、字体、换一段素材,都不在其中。 **把同一个概念换十种颜色,是一次测试,不是十次** —— 按平台自己的定义,它也只是一条创意。
整条广告的命运,在开头几秒就定了
一条视频广告不是被"观看"的,是被"熬过去"的。滑动很快,信息流很密, 而观看者的默认动作就是继续往下滑。开头不是广告的引言 —— 它是那场试镜,一旦没过,后面整条广告连登场的机会都没有。
平台的工作方式全都指向同一处。分发系统会把早期互动读成"这条创意值不值得更多预算"的信号, 这也是为什么一条视频前几秒的每一帧,权重都高于它之后的任何一帧。 从业者量的正是这件事:hook rate(也叫 thumbstop rate), 指曝光里活到"3 秒播放"的比例 —— 这是所有人先看的第一个数字, 因为它低,后面的一切都没有意义。
数据也同意这个直觉。对一百万条以上短视频的分析发现,**中位观看时长不到 7 秒**。 有一家机构对大量 DTC 创意的复盘发现,**73% 的电商视频广告死在那前三秒**。
这会给按传统方式做创意的人一个不太舒服的结论:**决定广告生死的那部分, 恰恰是整条广告里最小的一部分 —— 而在大多数工作流里,也是最贵去改的一部分。** 如果改开头意味着重跑整条视频,那么你手上杠杆最高的那次修改, 也正好是你最负担不起的那次。
天天在做这件事的人,怎么读一条视频广告
在修一条创意之前,你得先知道是哪个部分坏了。从业者把一条视频广告读成"广告内部的漏斗", 按顺序看三个指标:
诊断靠的是**这个顺序**,不是某一个数字。钩子弱但留存强,说明概念成立、只是开头可跳过。 钩子强但留存弱,是 DTC 视频里最常见的失败:**开头许诺了正文没有兑现的东西。** 而如果钩子、留存、完成率都健康、CPA 却很差,那问题根本不在广告上 —— 在报价、落地页、人群或归因。
在拿自己的数字和别人比之前,有两件事值得先知道。第一,公开的基准是第三方汇总值, 会随行业、版位和人群温度大幅摆动 —— 冷启动的信息流版位,钩住的人一定比温热的 再营销池少,所以**该拿自己账户的历史做对比,而不是拿一个博客数字**。 第二,比 hold rate 之前先确认分母:按留存口径(15 秒观看 ÷ 3 秒播放)算, 和按曝光口径算,是完全不同的两个数。
| 指标 | 它回答什么 | 怎么算 |
|---|---|---|
| hook rate(thumbstop) | 滑动停下来了吗? | 3 秒播放 ÷ 曝光 |
| hold rate | 过了钩子之后还留着吗? | 15 秒观看 ÷ 3 秒播放 |
| ThruPlay rate | 实际看完了吗? | 完成播放 ÷ 播放 |
三个问题,其实是同一个问题
因为约束藏在创意的语言背后,团队很少诊断对。三个常见症状,一个原因。
**"我们的测试永远测不出显著性。"** 只有 3 到 5 条变体时,期望赢家不足 1 个。 测试本身没出错,只是样本太小,稀有的赢家无法浮现。再做更多分析也解决不了。
**"赢家跑疲了,我们手上没有替补。"** 疲劳不是意外,它是一个有日程的事件。 把"表现下滑"从一次紧急事故变成一次例行替换的,是一个**永远装着下一批变体的队列** —— 而那是产能问题,不是投放问题。
**"我们知道是钩子的问题,但重拍不起。"** 这是流水线的成本形状,不是团队的能力问题。 如果改开头意味着重跑全部,那么能负担得起的开头数量就很少 —— **约束就这样伪装成了"创意判断力"。**
为什么产能问题在变严重,而不是变轻
三件事同时朝一个方向动了。
**注意力更短了。** 对 110 万条 TikTok 视频的分析发现, 30 到 60 秒的视频中位观看时长只有 **6.9 秒**。这意味着你不是在争最后十秒, 而是在争最前面三秒。而按一家机构的复盘,**73% 的电商视频广告死在那前三秒**。
**疲劳更快了。** 表现好的钩子会在数天内出现明显的效能衰减 —— 也就是说,刷新周期比大多数制作排期假设的要短得多。 一个季度出一批创意,追不上一周一条的衰减曲线。
**预算分配更依赖创意了。** 随着平台转向算法化投放,投手手上的杠杆变少了, 创意成了剩下最粗的那根。实际后果是:约束从"我们能定向得多准", 变成了"我们能往系统面前放多少条不一样的论证"。
三股力量,一个要求:测试面必须足够大、刷新必须足够快 —— 而这就把问题直接推回到"一条变体要花多少钱"。
成本形状是一个设计决定,不是自然规律
上面所有推论,都来自一个架构选择:**一条视频被当作一个成品文件, 还是被当作一组可以重组、重渲染的零件。**
如果是前者:每次改动都是一次新的完整生产,成本随变体数**线性增长**, 测试面被预算封顶。
如果是后者:生成一条视频产出的是**可复用的零件** —— 段落、配音、素材 —— 而一次改动只重跑**真正变了的那部分**。成本不再随变体数线性增长。 "一个月八十条"于是从一个财务决定,变成一个运营决定。
**这第二种形状,才是让高量产创意测试成为可能的东西。** 不是更聪明的模型,不是更好的简报 —— 而是**换了一个生产单位。**
BrandU 就是为这件事做的
产能问题不是策略问题,它是大多数视频制作方式的一个结构性属性 —— 而结构是可以被设计掉的。BrandU 就是围绕相反的结构建的。
**它从一条已经在跑的视频开始。** 不是从一句空白提示词,也不是从模板。你粘贴一条正在跑量的短视频链接, BrandU 会**逐帧看完**整条片子,弄清它为什么有效, 然后用**你的产品、你的卖点、你的口吻**把那套结构重建一遍。 你拿到的不是原片素材的复制 —— 而是那套论证,为你重做了一遍。 从已验证的东西起步不是抄近路,它比一个全新的、没测过的想法**赢的概率更高**。
**一条视频是作为零件生成的,不是一个文件。** 这是其他一切的前提。BrandU 把视频拆成互相独立的段落 —— 30 秒的片子是 5 个 6 秒的段落 —— 并且**保留已经生成好的零件**。所以:
**一条参考,能变成没有实际上限的一串测试。** 这才是产能问题真正被解决的地方。一条参考视频能产出改变钩子、改变开头、改变产品、 改变出镜人、改变语种的变体 —— **结构保持不变,"它在论证什么"在变。** 这正是平台真正奖励的那种结构性变化,而它是从**一份源素材**产出的,不是八十次拍摄。 一次生成最多 10 条变体,因为十条是一个合理的审阅单位 —— 然后你再跑下一次十条。 **你能做多少条没有天花板,而且成本不随数量上升:第 100 条变体的价钱,和第 2 条一样。**
**而且经济性是平的。** 因为贵的那部分 —— 模型 —— 是"每次改动跑一次",而不是"每条变体跑一次", 所以一条变体的边际成本是**渲染**,不是整条流水线。 这就是"一个活在提案里的测试项目"和"一个每周都在跑的测试项目"之间的差别。
- **换钩子,只有钩子重跑。** 改某一段文案,只重跑那一段的模型和它的配音;其余段落全部保留。
- **改样式、调顺序、换素材,只重渲染。** 不再调模型。
- **改一处,其余自己重排。** 时间轴与相关元素**自动重排** —— 你永远不用手动拖时间轴。
从诊断到修复
上面那套诊断,在这里接上成本形状。三个指标各自指向视频的不同部位 —— 而每一次修复的成本不同,取决于工作流能不能只改那一部分、而不重做其余。
最后一行对上量最关键。一条赢的创意疲劳时,你要的不是一次新战役 —— 而是**在已知有效的结构上,换下一个论证**。如果这一步的成本只是重做的一小部分, 按衰减曲线刷新就是负担得起的;如果等于整条重做,刷新就变成一季度一次, 中间那段时间表现一路下滑。
| 诊断说 | 要改什么 | 零件可复用时的成本 |
|---|---|---|
| 钩子率弱 | 开头几秒 | 只重跑开头那一段,其余保留 |
| 钩子强、留存弱 | 正文 —— 开头许诺的东西没有兑现 | 只重跑受影响的那几段 |
| 漏斗健康、CPA 差 | 不是广告的问题:报价 / 落地页 / 人群 / 归因 | 创意侧零成本 |
| 创意跑几天就疲劳 | 在已验证的结构上换角度或换钩子 | 从已有母版出一个新变体 |
50 到 80 条变体到底要多少钱
同样一条 30 秒视频(5 个段落),按 credits 算。
| 你做什么 | 全部重做 | 复用已有产物 |
|---|---|---|
| 做首轮母版(5 段) | — | 1,030 |
| 改一段的台词 | 1,030 | 350 |
| 改三段的台词 | 1,030 | 690 |
| 改样式 / 调顺序 | 1,030 | 180 |
| 加一个变体(同脚本) | 1,030 | 180 |
假设 30 秒视频(5 个段落)、标准画质。数字单位是 credits,不是货币。“复用”指不再调模型 —— 已经生成好的段落保留,只跑渲染。改一段的文案仍要重跑那一段的模型与配音。 第 80 条变体花 180 credits —— 和第 2 条一样。相对 1,030 的首轮母版,这是大约 **17%**。 决定"上量项目是否存在"的不是总额,而是**这个边际价格是否一直平坦。**
这一页不做什么
产出变体不等于测量它们。一套生成系统能告诉你它做了什么;它不能告诉你这条广告会表现如何。 任何声称自己的产出"高转化"的工具,说的都是那个**成品**,不是它**表现**的证据。
证明仍然要来自实验层:平台内测试,或者一个有对照组的实验。 产能给竞价系统足够多的选择 —— 但它不替你做选择。
另外两条边界:
还有一条关于我们自己的:BrandU 负责产出这个量。 **其中任何一条变体会不会赢,仍然只有竞价能回答。**
- 产能修不好一个弱的报价,也修不好一个坏掉的落地页。
- 产能不能替代"杀掉输家"。变体越多,要砍的就越多 —— 而且要靠数据砍,不是靠品味。
怎么跑起来
你的竞价里大约需要 75–80 条可信的变体 —— 不是 5 个聪明的点子。
不是颜色:平台把"同素材不同文字"当作同一条创意。
钩子的模式、角度、节奏 —— 不是导出的那个 MP4。
- **定基线。** 假设 6–7% 的变体会赢。如果你这个季度想要 5 个赢家,
- **在结构上变化。** 钩子、开头几秒、角度、形式、面向特定人群的说法。
- **尽量从已验证的东西起步。** 一个已经在跑的概念,赢的概率远高于一个全新的想法。
- **上线前就定好砍的阈值**,然后按数据砍,不按品味砍。
- **留下格式,不是文件。** 从一条赢的视频里留下来的,是那套结构 ——
粘贴一条链接。BrandU 用你的产品、你的卖点、你的口吻把那套结构重建一遍 —— 然后渲染出你可以一直改下去的变体,没动过的部分不用重新付费生成。
常见问题
- 按大约 6% 到 7% 的行业命中率,期望赢家数是一道算式,不是运气问题。 测 3 到 5 条,期望是零个赢家 —— 这是最常见的失败模式。15 条约等于 1 个。 30 条是一个可靠项目的起点。要稳定找到 3 到 5 个跑量的赢家, 你的计划里得有 50 到 80 条真正不同的变体;如果你同时跑多个活动或多个市场, 就是每月 100 条以上。
- 公开基准给出的数字是:大约 6% 到 7% 的变体能跑出量 —— 也就是说,大约每 100 条广告里有 93 条拿不到有意义的预算。 如果你的命中率远低于这个数,更可能的原因是测试面太窄,而不是创意太弱: 只有寥寥几条变体时,稀有的赢家没有统计学上的浮现空间。
- 这是效果广告分配预算方式的结构性特征,不是创意弱的信号。 平台会把曝光集中在早期有互动与转化信号的变体上,然后把其余的饿死。 少数创意吃掉有效的预算,长尾拿不到真实的曝光量。
- 要长到平台走出学习期。Meta 对广告主的口径是"多样化创意、去测、 然后让系统优化" —— 它的文档也说明,系统需要**彼此不同、有变化的素材**以及时间, 才能学会哪些组合能出结果。在一条变体积累到真实投放量之前就下判断, 通常只是在测量噪声。
- 它解决的是另一个问题,而不是它常被推销成的那个。 一套生成系统能告诉你它做了什么;它不能告诉你那条广告会表现如何。 当一个生成工具声称产出"高转化"时,那是对**成品**的主张,不是对它**结果**的证据。 生成真正改变的是**产能的约束**。如果一条变体的成本只是完整重做的一小部分, "50 到 80 条的测试面"就不再是一个预算话题。 至于某一条变体到底有没有用,证据仍然来自实验层。
- 不是"一个新文件"。按平台自己的口径:长得一样、钩子一样的创意, 会被当作**本质上同一条广告** —— 同一段素材换屏幕文字,仍然只算一条创意。 所以真正能产出"新广告"的轴,是那些改变论证本身的:不同的钩子、 不同的开头几秒、不同的角度、不同的形式。
要测多少条广告,才能找到赢家?
什么样的创意命中率算好?
为什么这么少广告能赢?
一次创意测试要跑多久才能下判断?
AI 做创意真的能提升结果吗?
什么算一条新创意?
相关页面: 视频广告用例 · 视频复刻是怎么工作的 · 对比视频广告工具 · 套餐与积分