素材加工怎么做才不被判搬运?两个号、200多条视频,我的踩坑记录
先说个可能有点扫兴的结论:我到现在也没找到一个能稳定过审的“配方”。去年 9 月开始做短视频账号,前后折腾过 200 多条片子,剪映专业版从 4.x 一路用到 5.x,FFmpeg 命令攒了整整一备忘录,中间废掉两个号。现在回头看,那些教你“镜像+变速+加滤镜”的教程,对机器的作用比想象中小,对观众的副作用比想象中大。
下面我把这大半年试过的加工动作摊开讲,再说说为什么我觉得大多数人从一开始就把“加工”这件事理解错了。
一、机器到底在比对什么
很多教程一上来就说“改 MD5”。这话对,但只对了大概 5%。
MD5 是文件级哈希,你把视频换个封装、重新导出一次,MD5 就全变了。这个层面的检测只在一堆老论坛时代有用,现在任何一个正经平台都不会只看文件哈希——因为你用剪映导出一次,什么都不改,MD5 也变了。平台真正在用的是两样东西:视频关键帧的感知哈希,和音频的声学指纹。
感知哈希这块,Facebook 在 2019 年开源过一套叫 PDQ 的算法,配套还有 TMK+PDQF 用来做视频匹配,代码在 GitHub 上挂着,有兴趣可以去翻。原理不复杂:把画面缩得很小、转成灰度、做 DCT 变换,然后只看低频部分,生成一串 256 位的哈希。因为只保留低频,所以整体亮度加 5%、加个滤镜、稍微缩放,哈希值变化很小;但你要是把画面镜像翻转、或者裁边改变了构图比例,哈希值就跳得很厉害。
音频这边,开源世界里的代表是 Chromaprint,AcoustID 拿它做音乐识别。它把音频转成频谱图,取 12 个音高类别做特征,所以只要旋律走向没变,你换码率、调音量、加一丢丢底噪,它照样能认出来。这就解释了我碰到过的一件怪事:有一条片子我做了镜像、调了色、换了 BGM,音轨还降了 6dB,结果发布两小时就被判了搬运。后来我把原声换掉、自己重新配了口播,画面一点没动,反而过了。所以顺序其实是反过来的——先把音频处理干净,画面反而是次要的。
二、我试过的加工动作,和它们的实际效果
下面这张表是我自己记的,样本很脏:两个账号权重不一样,发布时间不一样,素材来源也不一样,别当科研数据看,只能当个方向参考。
| 动作 | 具体参数 | 对感知哈希 | 对音轨指纹 | 观感代价 | 我的观察 |
|---|---|---|---|---|---|
| 镜像翻转 | 左右翻转 | 影响极大 | 无 | 画面里所有文字全反 | 过审确实更稳,但评论区必被指出来 |
| 缩放裁边 | 放大到 105%,1080 → 1134 再裁回 | 中等 | 无 | 画质略糊 | 最不起眼,性价比最高的一项 |
| 色相偏移 | ±3° | 小 | 无 | 基本看不出来 | 单用没用,要配合别的 |
| 变速 | 1.03–1.05 倍 | 中,帧结构变了 | 有,音高升约 0.85 个半音 | 语速快的人能听出来 | 1.05 以上开始明显跑调 |
| 改 GOP | FFmpeg 里 -g 60 | 中等 | 无 | 无 | 30fps 下 2 秒一个关键帧,跟默认 250 差别很大 |
| 音轨降音量 | 原声 -18dB,BGM -12dB | 无 | 大 | 人声糊了,观众直接划走 | 不划算 |
| 重新配音 | 全部重录 | 无 | 彻底重来 | 工作量大 | 过审最稳,也最累 |
| 抽帧 | 每 3 帧删 1 帧,30 → 20fps | 大 | 无 | 明显卡顿 | 得不偿失 |
我常用的一条命令大概长这样:
ffmpeg -i in.mp4 -vf "scale=1134:2016,crop=1080:1920,eq=hue=3:saturation=1.04" -c:v libx264 -crf 20 -r 30 -g 60 -c:a aac -b:a 128k out.mp4
注意 crop 那一步:缩放之后再裁回来,构图比例不变,这是缩边最稳的写法。直接把 scale 定死成 1080:1920 会拉伸变形,眼睛看得出来。
我印象最深的一次翻车就是镜像。素材里是一家店门口的招牌,翻转之后字全反了,第二天评论区第一条就是“招牌字反的,视频是搬的吧”。那条播放量其实还行,但互动全歪了,完播率掉得很难看。那之后我基本不用镜像了。还有一次我把一条视频变速到 1.08,本意是加快节奏,结果原声里的 BGM 升了 1.35 个半音,评论区有人说“这歌怎么听着不对”,我才反应过来音调也跟着跑了。
三、比机器更难糊弄的是观众
这是我最想说的部分,也是我觉得大多数教程没讲的地方。
你加工素材,其实是在同时应付两个“客户”。机器只看像素和频谱,你看得见它,它看不见你。观众不一样,观众看过原视频。一个素材一旦火过,几百万人看过原版,你把它镜像一下、加个滤镜、变速到 1.05,对机器来说是一串新的哈希,对这几十万人来说是“这个我看过”。然后他们划走,完播率掉,算法收到负反馈,接着就是限流。
我专门做过一次对照。同一个素材,一条只做常规去重,镜像加调色加变速;另一条在开头 3 秒加了我自己出镜的一句话:“原视频用的是空气炸锅,我换成烤箱试了,差别挺大。”两条发在同一个号上,隔了 10 天。第二条完播率高了差不多 40%,第一条第三天就没什么量了。这个对照一点都不严谨,变量太多,但它至少说明了一件事:观众能感觉到你有没有加东西。
我说的“信息增量”不是什么高级词,就是观众看完能拿到原视频里没有的东西。可以是你的实测结果,可以是价格对比,可以是你所在地的差异,甚至可以是你吐槽得比原版好笑。反过来说,如果你的加工过程观众一点都感觉不到,那你在观众眼里就等于不存在,你的号就永远是个搬运号,哪怕它过了审。
四、我现在的做法,一套四步流程
我现在基本固定成四步,写下来给你参考,不用照抄。
第一步,先看这条素材有没有“增量口”。 如果我也想不出能在哪里加东西,这条素材我就不做了。这是最快筛掉一半素材的办法,省下来的时间比加工本身值钱得多。
第二步,处理音频。 要么全部重录口播,要么把原声压到 -20dB 以下、只留 BGM 和自己配的解说。这一步优先级最高,单纯改画面基本不解决问题。
第三步,动画面,走轻加工。 缩放 105% 再裁回原尺寸、色相 ±3°、饱和度 ±4%、GOP 设成 60。这四样加起来画面几乎看不出变化,但关键帧结构和帧级哈希都变了。不用镜像,不用抽帧,不用把帧率往下压。
第四步,剪结构。 开头 3 秒重做,把原视频的中段和结尾调换,最后加一个 1.5 秒的自己的收尾。这一步对机器影响不大,对观众的留存曲线影响很大——因为前 3 秒决定大部分人走不走。
最后说一件我到现在也没完全想明白的事。同一个素材,同一套参数,A 号发出去风平浪静,B 号发出去当天就被限。两个号粉丝数差三倍,注册时间差一年多。我倾向于认为账号权重在判重里的比重,比我们想象中大,单条视频的加工精度反而是小头。所以我现在的精力更多花在选题和账号健康度上,加工这块做到 70 分就收手了,不再为那最后 30 分熬夜调参数。
你要是有什么更稳的做法,欢迎在评论区说,我确实还没找到那个“配方”。