用 Opus 5 剪片:我沒教它怎麼剪,只跟它說「剪完要長什麼樣」
如果你是在 IG 留言「剪輯」被傳送過來的——對,就是這篇,指令都在下面。
我最近發了一支 45 秒的直式短影音,有字幕、有系統動畫、有 CTA——整支是我用 Claude Code 剪的。
原料是兩段隨手錄的片段,加起來三分鐘,內容非常零散:同一句話講了三四次、中間一堆停頓、想到什麼講什麼、順序也是亂的。錄影時間不到五分鐘。
重點不是「AI 會剪片」——這件事我一年前就寫過了。這次不一樣的是:我完全沒教它怎麼剪。
先講最短的做法:你其實可以直接開口
如果你現在就想試,不用先讀完這篇。把素材丟進一個資料夾,打開 Claude Code,跟它說:
我的影片素材在 [資料夾],請幫我剪成一支 60 秒的短片。 先幫我把台詞辨識出來,然後照語意幫我安排劇本。
真的就這樣一句。它會自己去看素材、跟你說缺哪個工具(缺的它可以直接幫你裝)、把台詞抓出來、排一版劇本回來問你行不行——你只要一直回答「可以」或「這裡我想改成 OO」,它會帶著你走完。
下面那些——怎麼把目標講得更清楚、B-roll 怎麼配、怎麼驗收——都是讓成品更好看的,不是開始的門檻。先跑一次,你會比較知道自己要什麼。
為什麼是現在:Opus 5 的三個特性
以前用 AI 剪片,我得像個工頭:先轉錄、再標時間、然後在第 12.4 秒切一刀、去掉這個「呃」……每一步都要盯。
Claude 這次發布的 Opus 5,有三個特性讓這件事整個翻過來:
- 它最擅長的就是「長時間自主完成任務」——官方的定位是複雜的、長時程的工作。而且它偏好你一次把目標講完整、然後讓它跑,這樣的效果比你一步一步盯著更好。這跟剪片的性質剛好對上:剪一支片是幾十個決定串在一起,中間被打斷反而更慢。
- 它會自己驗證自己的工作——這不是我發現的偏方,是這個模型本來的特性:你不用叫它檢查,它自己會做。下一段就是這件事的實例。
- 一百萬 token 的上下文——兩支影片的完整逐字稿、我累積的所有剪輯規則、整套程式碼,一次全部放得下。它不會做到後面忘記前面講過什麼。
所以指令的重心從「怎麼做」變成「做完要長什麼樣」。
這次我基本上只講了四件事:
- 我希望45 秒左右
- 我不想露臉太久,中間都切畫面
- 講到重複的、停頓太長的、語速不一致的都處理掉
- 結尾要能引導留言
然後它就自己去做了:從那三分鐘裡挑出能用的段落、重排成一條有起承轉合的敘事、把贅字和停頓剪掉、配上畫面、上字幕、調色、對齊音量。
上面第 2 點的實例:它自己把檢查表翻出來跑
做到後面我沒有叫它檢查任何東西,它自己冒出一張清單,然後一項一項跑:
- 字幕是不是等於聲音
- 每一句的尾音有沒有被切掉
- 接點會不會有爆音
- 影片長度是不是等於音訊長度
- 片尾不是黑畫面
而且真的有擋下來過。中間有三次它直接拒絕出片,跟我說字幕跟聲音對不上——一次是它把品牌名聽錯、一次是我同一句重講四次讓它標錯時間、一次是片尾的雜音被誤認成一句話。這些如果沒擋,成品就是字幕在飄。
老實說,這些條件不是它憑空想出來的——是我過去做片一次次踩坑累積下來的規則,早就寫在專案的說明文件裡了。差別在於:
- 以前:規則寫在那,但我得一條一條提醒它「記得檢查字幕有沒有等於聲音喔」,忘了講就是漏掉。
- 現在:我只說「你自己列一張表跑一遍」,它會自己去把規則翻出來、套上去,不過就擋下來不給我。
這才是我覺得 Opus 5 適合拿來做這種事的原因:你把「什麼叫做好」交給它以後,它會對自己負責。 而且你踩過的坑會累積——寫下來一次,之後每一支都自動生效。
以上是「為什麼可以這樣做」。下面是想做得更好看、更省時間的做法——環境怎麼裝、目標怎麼描述、指令怎麼下、畫面怎麼配。只想先跑一次的話,看到這裡就夠了。
開始之前:其實只要裝一個東西
(走上面那條「直接開口」的路可以先跳過這段——缺什麼它會在需要的時候跟你說。想先弄清楚會用到什麼再開始,就往下看。)
你手動要裝的只有兩樣:
- Claude Code——桌面版 App 裡就有,不用另外裝,記得切到 Opus 5(付費版)。
- FFmpeg——處理影音的免費工具,剪接、轉檔、上字幕全靠它。
- Mac:
brew install ffmpeg(沒有 Homebrew 的話去 ffmpeg.org 下載靜態版) - Windows:
winget install ffmpeg
- Mac:
其他的讓 Claude Code 自己裝就好,但先知道等一下會冒出什麼比較安心:
| 用途 | 套件 |
|---|---|
| 把影片的話轉成文字+標時間 | mlx-whisper(Mac M 系列最快)或 openai-whisper |
| 把時間標到「每個字」的精度 | torch、torchaudio、transformers(跑 wav2vec2 對齊) |
| 畫 B-roll 圖卡動畫 | Pillow |
| 算音量、做音訊分析 | numpy |
不用自己一個一個裝。開工前先丟這句給它就行:
我要做影片自動剪輯,請先幫我檢查環境:
ffmpeg 有沒有裝、Python 版本、需要的套件有沒有齊,
缺什麼你直接幫我裝,裝之前先跟我說你要裝什麼。
先學會描述目標:四個空格
指令沒有什麼神奇咒語,難的是把「你要什麼」講清楚。我的做法是先填這四格,填完就等於指令寫好了:
| 空格 | 怎麼填 | 例子 |
|---|---|---|
| 規格 | 多長、直式還是橫式、發哪裡 | 45 秒、直式、發 IG Reels |
| 臉跟 B-roll 的比例 | 你的臉佔多少、其他畫面佔多少 | 開頭跟結尾露臉,中間七成切 B-roll |
| 一定要拿掉什麼 | 講「不要」比講「要」好定義 | 贅字、超過一秒的停頓、我重講的部分 |
| 結尾要幹嘛 | 收在哪裡 | 引導觀眾留言「OO」兩個字 |
三個小訣竅:
- 講「完成後長什麼樣」,不要講「你要怎麼做」。「我不想露臉太久」比「第 8 秒切到 B-roll」好一百倍——後者是你在做它的工作。
- 不確定的就寫「你決定,但先告訴我你打算怎麼做」。它會給你一版方案,你再挑比較快。
- 「不要什麼」通常比「要什麼」容易講。你可能說不出好影片長怎樣,但一定講得出「不要有一堆呃」。
三段可以直接複製的指令
把上面填好的四格貼進第一段的框裡就能跑。(配畫面另外還有一段,在下一節。)
① 開工(給目標,不要給步驟)
我有幾段隨手錄的影片素材在 [資料夾路徑],內容很零散。
請先幫我把台詞辨識出來,然後排一版剪輯劇本給我看。
我要的成品:
- 規格:[ ]
- 臉跟 B-roll 的比例:[ ]
- 一定要拿掉:[ ]
- 結尾要:[ ]
素材的順序可以重排,你覺得怎麼講比較好懂就怎麼排,
排完先跟我說你為什麼這樣排。
② 過稿(只確認順序,其他讓它去做)
開始剪之前先給我兩樣:
1. 你打算留下來的台詞逐字表(照順序)
2. 你砍掉了什麼、為什麼
我確認過順序再做完整的影片。
這裡我要老實講一件事:以前這一步我會多要一樣東西——一段「只有聲音的粗剪」,先用耳朵聽接點順不順。這次完全沒用到。
因為它剪得夠準了,接點的問題直接看成品講就好,不用先聽半成品。反而是**「順序」值得先用文字看一眼**——敘事順序排錯,後面所有工都白做;而順序對不對,讀那張逐字表三十秒就知道了。
剩下的別急著在中間卡關,讓它一路做到成品,你再一次講完要改哪裡。
③ 驗收(讓它自己定義什麼叫好)
出片之前,你自己列一張檢查表跑一遍:
把「這支影片要沒問題、必須成立的條件」全部寫出來,
有任何一項沒過就不要出片,直接告訴我哪一項沒過。
它列的通常比你想得到的還多。然後把你自己聽出來的問題也補進去——寫成一份規則檔放在專案裡,下次它會自己翻出來用。你踩的坑就是這樣一次一次變成資產的。
中間那些畫面怎麼來:五種 B-roll 做法
「不要一直看到我的臉」講起來容易,但總得有東西補上去。這五種都能用,成本跟效果差很多:
| 做法 | 怎麼弄 | 最適合 | 成本 |
|---|---|---|---|
| ① 你自己的舊成品 | 把你做過的東西全螢幕插進來 | 講「我做過什麼」的時候,這是最有說服力的 | 0 |
| ② 螢幕錄影/截圖 | 錄一段操作過程,靜態圖就用推近、平移動起來 | 教學、工具介紹 | 0 |
| ③ 程式畫的圖卡動畫 | 讓 Claude 寫 Python(Pillow)一格一格畫 | 抽象概念、沒有東西可拍的時候 | 0 |
| ④ 免費素材庫 | 到 Pexels 找情境影片 | 鋪陳情緒、氛圍 | 0 |
| ⑤ AI 生成 | Kling、Seedance 生片段 | 完全拍不到的場景 | 要錢,且不一定一次過 |
我那支影片裡的系統畫面,全部是 ③——不是 AI 生成的影片,是 Claude 寫程式一格一格畫出來的。好處是文字不會歪、要改哪個字就改哪個字、幾百張圖的成本跟幾十張一樣(AI 只花在寫程式,畫圖是程式自己跑)。
兩個實際好用的判斷:
- 哪幾句要配畫面? 講到具體的東西(數字、名詞、流程、步驟)就配;講感受、講結論就回到你的臉上。人講心裡話的時候,觀眾要看的是你的表情。
- B-roll 要蓋多滿? 三種都可以,混著用最好看:整個蓋滿(畫面資訊多的時候)/上面放畫面、下面留一塊你的小視窗(想維持存在感)/畫中畫小框浮在你旁邊(只是補一眼)。
要 Claude 幫你做 B-roll,這樣講就好:
中間這幾句需要配畫面。素材我有的放在 [路徑],
沒有素材的段落你直接寫程式畫成圖卡動畫,風格:[簡潔的系統介面/手繪感/純文字大字卡]。
講到具體的東西才配畫面,講感受的地方回到我的臉上。
先給我一版「哪一句配什麼畫面」的表,我看過再做。
一個提醒:耳朵還是你的
雖然它會自己檢查,但有些東西機器量不到。
這次我聽出三個接點怪怪的,都是同一個原因:那是「同一句話中間的猶豫」,不是句子與句子之間的換氣。它把停頓剪掉了,但沒剪掉前面那個拖長的尾音——聽起來就還是在猶豫。這種事沒有指標可以量,只能戴上耳機聽。
所以流程是:它負責做到「機器能驗的都過」,你負責聽最後一遍。 這樣分工最省力。
從手機裡隨便一段沒剪的影片開始就可以。把四格填一填,剩下的交給它。
延伸閱讀
- 用 Claude 自動剪影片:Whisper + FFmpeg 實作筆記——想知道底層怎麼運作看這篇
- AI 影片量產心法:建一次模板,之後換劇本 10 分鐘就出片——要固定產片流程看這篇
想用 AI 讓生活與工作更輕省,追蹤 AI 生活實驗室 👉 @life.coach.mtcity,我們一起玩 AI!