素材加工这件事,我返工了整整两年才摸到门道
先说个具体的事。去年10月我接了个本地家具店的单子,要出12条15秒的竖版短视频。素材是老板用手机拍的,1080P、30fps、H.264,听着挺标准对吧?问题是12条视频分散在4台设备里——iPhone 13、一台小米、一个老款索尼A7M3、还有个GoPro Hero 8。混在一起剪的时候,PR时间线播放卡到2帧,音频一个44100Hz一个48000Hz,对轨对到我想砸键盘。
那次我熬到凌晨3点,最后是靠把全部素材统一转成 ProRes Proxy 代理文件才救回来的。12条视频,从拿到素材到交片,整整用了41个小时。后来我把流程重做了一遍,同样的工作量现在大概9小时能搞定。差的不是手速,是素材加工的方法。
我到现在也不算专业出身,就是个兼职接单的,白天上班晚上剪片子。所以下面写的都是我自己反复撞墙撞出来的,不一定是最优解,但都是真跑通过的。
先分清楚:素材加工不是一件事,是三件事
很多人一说素材加工,脑子里就是「剪辑」。其实完全是三个层次,混在一起干才会乱:
- 格式层:编码、封装、分辨率、帧率、采样率、色彩空间。这一层的目标是统一,让所有东西能在同一条时间线上跑。
- 质量层:降噪、锐化、稳定、补帧、调色、响度归一。目标是提升或者补救。
- 内容层:剪辑节奏、二次创作、包装。目标才是表达。
90%的人卡在第一层。他们跳过格式统一,直接开始剪,剪到一半发现素材放不大、音频不同步、导出的颜色跟预览不一样。我现在的规矩是:素材进项目文件夹之前,必须全部过一遍格式统一。这一步不管多急,都不跳过。
格式层:我现在的标准参数
竖版短视频项目,我统一成这套:
- 视频:H.264,1920×1080,27fps 或 30fps(跟原素材多数派走,不硬转帧率),CRF 18,preset slow,GOP 50,pix_fmt yuv420p
- 音频:AAC,48000Hz,立体声,192kbps
- 容器:MP4,打开 faststart
FFmpeg 一条命令批量搞定:
#!/bin/bash
for f in *.mp4; do
ffmpeg -i "$f" -vf "scale=1920:1080:force_original_aspect_ratio=decrease,pad=1920:1080:(ow-iw)/2:(oh-ih)/2,fps=25" \
-c:v libx264 -crf 18 -preset slow -g 50 -pix_fmt yuv420p \
-c:a aac -ar 48000 -ac 2 -b:a 192k -movflags +faststart \
"out_${f}"
done
(上面那段是我实际在用的,命令里的示例帧率写的是25,你按自己的项目改成30就行。)
注意那个 pad 参数。scale 加 force_original_aspect_ratio 只是缩放,不加 pad 的话画面尺寸和容器尺寸对不上,加了 pad 才是真正居中补边。我第一次写的时候漏了 pad,导出的视频全部变成 1920×1080 但画面实际是 1440×1080 的,平台自动裁切以后人物脑袋被切掉一截,客户直接打电话来问。
CRF 18 是什么概念?一条3分钟的1080p25的视频,大概落在 250到400MB 之间。CRF 数字越小质量越好体积越大,23是默认值,我一般不给客户用23——因为客户拿到手还要压一遍上传,两次压缩的画质损失肉眼能看出来。
代理文件这一块单独说。如果你电脑不是M系列芯片或者近两年的独显,4K素材直接扔时间线就是自虐。转 ProRes Proxy,1080p25 大概 45Mbps,文件比原片还大,但播放丝滑。剪完最后用原片回套,PR里叫「重新链接媒体」,达芬奇里叫「重新链接代理」,都在右键菜单里。
质量层:别乱修,先判断素材值不值得修
这里有个可能有点反直觉的观点:大部分素材的问题不是画质不够好,是不值得修。
我见过太多人拿到一段糊的手持素材,先 Topaz Video AI 放大到4K,再 Neat Video 降噪,再锐化,折腾两个小时出来还是糊的——因为原始素材就没有足够的信息量。手持抖动 + 暗光噪点 + 压缩块效应,这三样凑一起,神仙难救。
我的判断标准按顺序看三条:
- 原始文件码率。低于 6Mbps 的 1080p,基本放弃治疗。
- 光照。暗部噪点肉眼能不能看出来,如果有明显的彩色噪点,先降噪再谈其他。
- 运动模糊。这个修不了。抖动的可以上稳定器,模糊的真的没辙。
能修的优先级是:调色 > 降噪 > 锐化 > 放大。顺序不能反,反了就是把噪点一起放大,越修越脏。
调色我用达芬奇的色轮,一般只动三个地方:Lift 提一点点暗部(+0.01到+0.03),Gamma 中间调微调,饱和度整体 +3 到 +8。超过10就假了,人脸会像抹了粉。LUT 我用得很少,除非客户有品牌色要求,市面上的 LUT 套上去十有八九肤色会偏。
降噪:Neat Video 或者达芬奇自带的时域降噪,强度别超过30%,超过就是塑料脸,一帧一帧看还行,连着看特别假。
锐化:PR 的 USM 锐化,数量 20到30,半径 1.0,阈值 3到5;达芬奇的锐化 0.45 到 0.5 就够。锐化永远是最后一步,导出前加。
内容层:关于去重这件事,我想说点得罪人的
网上有一堆教程教你混剪去重,方法包括改MD5、变速1.02倍、镜像、加画中画、裁剪边缘2%、加滤镜层。
改MD5是完全没用的。 平台审的是内容指纹,不是文件哈希。字节、快手这些平台用的都是基于帧的感知哈希加音频指纹,你改个文件哈希,在指纹层面一模一样。变速1.02倍、镜像这种轻微扰动,对帧指纹的影响也很有限,尤其音频指纹,波形不变基本白搭。
我自己的观察(不保证,只是经验):真正能改变内容指纹的是结构性的改写——把原来15秒的三段式换成20秒的四段式,把A素材的前3秒和后3秒调换,把原声换成重新录的解说,画面和音频同时变。这种改法倒不是为了骗算法,是因为你确实产生了新东西。
反过来说,如果加工只是把别人的东西换个皮,那被限流是合理的。2022年有段时间我专门做影视混剪,连着七八条播放量都是两三百,后来我把方向换成「用自己的话讲一个片段」,素材还是那些素材,播放量到过12万。素材没变,加工方式变了。
工具对比:我用了三年的组合
| 工具 | 我用它干什么 | 优点 | 缺点 |
|---|---|---|---|
| FFmpeg | 批量格式统一、抽帧、加水印 | 免费、可脚本化、批量快 | 学习曲线陡,参数记不住 |
| 剪映专业版 | 快节奏短视频、字幕识别 | 识别准、模板多、免费 | 导出码率不可控,画质一般 |
| Premiere Pro | 长项目、多轨、代理剪辑 | 生态好、回套方便 | 贵,M1之前优化很烂 |
| DaVinci Resolve | 调色、降噪、交付 | 免费版就够用,调色最强 | 对显卡要求高,节点逻辑要适应 |
| Shutter Encoder | 单个文件转码、抽音频 | 免费、图形化FFmpeg | 批处理不如命令行走 |
| Audacity | 音频降噪、响度 | 免费 | 界面丑,操作反人类 |
日常组合是:Shutter Encoder 或 FFmpeg 做格式统一 → 达芬奇调色降噪 → PR 剪辑(或者直接用达芬奇剪)→ 导出后再用 FFmpeg 压一遍。
最后一压为什么要单独做?因为达芬奇直出的文件码率往往过高,一条15秒的短视频能到 80MB,上传前用 CRF 20 压一遍,体积能砍掉大约60%,肉眼几乎看不出来。
三个我自己踩过的坑
坑一:以为高分辨率就是好素材。 Pexels 上一堆标着4K的素材,码率只有 10Mbps,放大到200%就是糊的。我现在看素材先看码率和拍摄设备信息,不看分辨率标签。
坑二:批量处理不看抽帧预览。 有一次我用脚本给300条素材批量加滤镜,跑了一个半小时,结果发现某个参数写错,全部素材饱和度+40。重跑又是一小时。现在的规矩是:批量脚本先跑3条,抽帧看,确认了再跑全部。
坑三:字体和音乐版权。 思源黑体(SIL开源协议)、阿里巴巴普惠体(免费商用)是我主要用的中文字体。音乐我用 YouTube Audio Library 和 Uppbeat,Epidemic Sound 是付费的但商用授权清楚。别用剪映自带音乐库导到别的平台,也别用网上下载的所谓免费商用音乐,十个里八个有问题。我朋友就因为一条背景音乐被投诉过,赔了800。
最后说个我自己的判断
素材加工真正的门槛不在软件,在素材库的结构。
我现在所有素材按这个结构存:项目名/日期/素材类型/,素材类型固定四种:A-roll(主体画面)、B-roll(补充画面)、音频、图形。文件名格式是 日期_来源_内容_版本,比如 20240312_pexels_咖啡店手冲_v2.mp4。听着很事,但我找素材的时间从平均每条视频20分钟降到了3分钟左右。
另外,100G素材最后真正用上的可能只有8G。这不是浪费,是筛选成本。但如果你一开始就把所有选中的素材都做了格式统一和代理,那就变成100G的加工成本——先粗筛,再加工,这个顺序千万别搞反。
写到这里差不多该收尾了。要说这三年最大的变化,不是学会多少软件,是我终于不再一拿到素材就开剪了。