阿廷的 AI 廣告影片燒到第三次重生成,他才發現自己一直在跟 AI 猜謎
已更新:8月7日

阿廷(示意人物,一位經營小家電品牌社群廣告的行銷專員,非真實客戶)月底打開 AI 影片生成平台的用量報表,那一格額度使用量是紅的。他這個月只做了三支 15 秒的產品短片,卻已經把原本預估能做十支的額度燒掉一半。老闆在群組裡問了一句:「這幾支影片是重拍了幾次?」他心裡有數,答案不好意思說出口。
第一關:把「兩個人打架」交給 AI,結果劍消失了
阿廷第一支要做的是動作類廣告素材——兩個角色對打的張力畫面。他打的提示詞很直覺:「兩位戰士打鬥,戲劇化、史詩感、電影感、高畫質」。這種寫法他過去打字幕、寫貼文標題都這樣寫,加幾個「厲害的形容詞」感覺就會生效。
生成結果卻讓他愄住:武器在畫面中消失了大半段,又莫名其妙冒出來,動作僵硬不自然。他這才意識到,「戲劇化」「電影感」這些詞聽起來很有份量,但其實只是情緒詞——它們形容的是一種氛圍,卻沒有告訴 AI 畫面裡實際要發生什麼事、武器長什麼樣、怎麼揮動。模型只好自己猜,猜錯了,額度就這樣扣掉一次。
阿廷做了大部分人第一次失敗後會做的事:回頭補一個詞,把「打鬥」改成「兩位戰士用劍打鬥」。武器確實出現了,但動作依然不自然,鏡頭也殫無設計——因為他還是只講了「畫面裡有什麼」,沒講「這個鏡頭該怎麼拍」。
第二關:換一支風格類影片,問題卻不是「打鬥」,是「風格會飄」
第二支素材阿廷想做動漫風格的短片。這次他學聪明了,把想像的畫面寫得更具體——一位女孩在海邊小攞吃麵,溫馨懷舊。畫面確實有動漫感,但整整十秒鐘只是同一個靜止鏡頭,女孩維持同一個姿勢吃麵,看起來很平、很無聊。
他發現,光是把「畫面內容」寫清楚還不夠——風格類影片最容易出問題的地方不是「畫面裡有什麼」,而是「鏡頭之間怎麼切換」「風格會不會走著走著就飄掉」。這跟第一關的破紽是同一個根因的不同表現:提示詞只描述了「靜態畫面」,卻沒有告訴模型「這個場景需要幾個鏡頭、怎麼鋳接」。
第三關:產品廣告最容易穿幫的地方,是打光
第三支才是真正要拿去投放的產品短片——一款新款運動鞋。阿廷這次用最常見的產品廣告寫法:「一雙運動鞋在展台上旋轉,乾淨的攝影棚產品影片,柔和的燈光,質感高級」。結果出來的畫面旋轉軌跡飄移、剪接生硬,整體看起來很明顯是「AI 生成的」——這正是他最不想讓老闆看到的結果,因為這支影片如果過關,是要直接拿去投廣告的。
到這裡,阿廷才把三次失敗串起來看懂同一件事:他每次提示詞裡都只交代了「畫面裡有什麼」(主體),卻從來沒交代「這支影片該怎麼拍」——鏡頭類型、運鏡方式、速度、打光方式、風格基調,他一項都沒說。模型不知道這些,只能自己猜一個版本出來,猜錯了,額度就是真金白銀燒掉的一次重生成。
轉折:問題從來不是「哪個工具不夠好」,是提示詞少了一半
阿廷原本以為是平台或模型「不夠聪明」,才需要不斷重試。但當他把提示詞拆開檢查,才發現一支「打勾及格」的提示詞其實該包含六個要素:主體(拍什麼)、動作(在做什麼)、鏡頭類型、運鏡方式、速度、打光與風格——外加一個幾乎所有人都會漏掉的「負面提示詞」,把之前反覆踩到的雷(武器消失、鏡頭呆滞、旋轉飄移)提前寫進「不要出現」的清單裡,防止同一個錯誤在下一次生成又發生一次。
他用同一張起始畫面、同一組設定,只把提示詞換成把六要素寫齊的版本——結果一次到位:劍鬥動作流暢、鏡頭運動有設計;動漫短片切了好幾個鏡頭,風格穩定不飄;運動鞋廣告燈光包裹著鞋身,反光乾淨,剪接跟著節奏走。三次測試,三個完全不同的破紽(動作、風格、打光),但修正的方法是同一件事:把「情緒詞」換成「結構」。
這跟省 AI Token 的錢,是不是同一套邏輯?
阿廷做的是影片生成,燒的是這個平台的「credits(生成額度)」;如果你平常用的是文字類 AI(寫文案、寫程式、做客服對話),你燒的則是 AI Token King 這類工具會幫你算給你看的「AI Token」。雖然計費單位不同,但「指令不夠精確、只好重試」這個燒錢的原理是一樣的——提示詞含糊,模型就要猜、猜錯就要重跑,重跑就是再花一次錢。這也是為什麼站內另一篇文章談「AI Token 為什麼這麼貴」時,同樣把「重複嘗試」列為最容易被忽略的隱形成本之一。
(釋清:Higgsfield 的 credits 是影片生成額度,跟 AI Token King 計算的 AI Token(文字模型用量)是兩種不同的計費單位,本文借的是同一個省錢原理,不是說兩者定價方式相同。)
結尾:阿廷現在下指令前,會先問自己六個問題
那次月底報表事件之後,阿廷養成一個習慣:每次要生成任何 AI 素材前,先在腦中(或筆記裡)把六個要素過一輪——拍什麼、在做什麼、什麼鏡頭、怎麼運鏡、多快、打光跟風格是什麼——最後補一句「不要出現什麼」。他不再是「先生成、壞了再修」,而是把猜測的成本,提前用五分鐘的思考換掉。
下個月的用量報表,那一格終於不再是紅的。
FAQ
Q1:為什麼加了「電影感」「史詩感」這些形容詞,生成結果還是不對?
因為這些是「情緒詞」,只形容整體氛圍,不描述畫面裡實際要發生的動作、鏡頭怎麼拍。模型收到情緒詞,仍然要自己猜實際內容,猜錯的機率不會因為形容詞多就降低。
Q2:一支「及格」的提示詞應該包含哪些要素?
六個核心要素:主體(拍什麼)、動作(在做什麼)、鏡頭類型、運鏡方式(怎麼移動鏡頭)、速度、打光與風格基調。外加一個負面提示詞,把已知會出錯的地方提前排除。
Q3:負面提示詞真的有用吗?聽起來像多此一舉。
有用,而且是最常被忽略的一項。它的作用不是「補充畫面內容」,而是把你已經在前幾次生成裡踬過的雷明確列出來,提前告訴模型不要再犯,直接降低下一次重生成的機率。
Q4:動作類、風格類、產品類影片,提示詞的重點一樣嗎?
不完全一樣。動作類最怕「運鏡與速度」沒講清楚(動作愈大,模型愈容易失去一致性);風格類最怕「鏡頭鋳接與風格穩定度」沒講清楚;產品類最怕「打光與反射」沒講清楚,這三種失敗模式在本文三個關卡裡分別對應到。
Q5:這篇講的是影片生成的 credits,跟 AI Token King 算的 Token 是同一回事嗎?
不是同一種計費單位——影片平台的 credits 通常是「每次生成扣一次額度」,AI Token King 計算的 AI Token 則是文字模型依用量(輸入/輸出字數)計費。兩者商品不同、計價方式也不同,本文借用的是同一個底層原理:提示詞不夠精確、模型只能猜,猜錯了就要重跑,重跑永遠是要花錢的。
資料來源聲明
本文參考整理自 YouTube 頻道 Youri van Hofwegen 於 2026 年 7 月 11 日發布的影片《STOP Wasting Credits & Master Prompt Engineering in 12 Minutes》,並經重新組織與論述改寫,非逐字翻譯,亦已移除原標題「STOP」「Master...in 12 Minutes」等命令式與誇大教學語氣。文中「阿廷」為說明用示意人物,非真實客戶。文中提及之第三方平台(Higgsfield、C-Dance、video prompt.studio)功能描述,以原影片發布當下版本為準,如與讀者實際操作畫面不同,請以該平台官方說明為準,本文不構成對任何第三方平台的推薦或保證。
延伸閱讀
立即行動
不管你燒的是影片生成的額度,還是文字模型的 Token,浪費的根源往往是同一件事:不知道自己的指令、自己的用量,實際花在哪裡。免費試用 AI Token King,把模糊的帳單變成看得懂的用量報表,下一次重生成前先想清楚,而不是先花錢再後悔。

留言