MiniMax-H3 本地生成實測:RTX 4060 8GB 能跑嗎?珍珠娛樂的踩坑與建議
凌晨的工作站停在 99%,記憶體幾乎吃滿,最後留下一行 CUDA out of memory。這是珍珠娛樂團隊第一次在 RTX 4060 8GB 上測 MiniMax-H3 的結果:沒有影片,只有 4 分多鐘的等待和一份錯誤紀錄。
隔天換了量化模型、獨立 ComfyUI 環境與更保守的記憶體配置,480×832 的 5 秒片段終於在 7 分 59 秒內完成。之後再測 704×1280,並加入 Spectrum,單段總時間由 31 分 40 秒降到約 23 分 20 秒。這台中階顯卡確實能跑,但離「裝好就能穩定交件」還隔著不少工程判斷。
這篇不寫逐行安裝教學。我們想回答的是另一個更接近商業現場的問題:MiniMax-H3 本地生成目前適合放進哪一段製作流程,又有哪些工作仍不該急著交給它。
MiniMax-H3 開放了什麼,哪些能力仍需官方服務?
MiniMax-H3 是能同時處理文字、圖片、影片與音訊脈絡的影片生成系統。官方公開的 H3-Base 可在本地生成 24 fps、32 kHz 立體聲的影音內容,包含文字轉影片、首尾幀控制與參考素材驅動等模式。
「開放權重」這四個字要讀完整。H3 的完整系統還包括 H3-Context-IR 與 H3-Regenerate-2K;前者負責整理複雜的多模態指令,後者用於 2K 重生成,截至 2026 年 8 月 12 日都沒有包含在本地釋出內容裡。只下載 H3-Base,可以做出原生影音,卻不等於完整複製官方線上服務的 2K 工作流。
| H3 系統部分 | 目前能否純本地使用 | 對製作團隊的影響 |
|---|---|---|
| H3-Base FL2VA/Ref2VA | 可以,官方已公開模型權重與推理支援 | 可處理文字、首尾幀與參考素材,產出原生影音 |
| H3-Context-IR | 未隨本地版本釋出,官方提供 API | 本地工作流需自行整理提示詞與素材關係 |
| H3-Regenerate-2K | 尚未開放本地部署 | 官方完整 2K 品質不能直接視為本地版的預期結果 |
授權也有邊界。H3 現行採用 MiniMax H3 Community License Agreement,並非 Apache 2.0。條款列出的排除地區包括歐盟、英國、韓國與美國,也要求公開環境中的生成內容清楚揭露為機器生成。官方曾在 X 表示正處理轉向 Apache 2.0,但模型頁目前仍維持 Community License。企業若要公開投放、跨境使用或把 H3 包進產品,應在執行前再讀一次最新條款;本文提供的是製作觀察,不是法律意見。
授權狀態核對日期:2026-08-12。官方條款後續若有更新,應以模型頁最新版本為準。
模型權重能下載,只解決了「拿不拿得到」。能不能穩定跑、可不可以對外交付、素材能用到哪些市場,仍是三道不同的檢查。
RTX 4060 8GB 到底能不能本地生成?
答案是可以,條件比顯卡型號更重要。我們的測試環境為 Windows、RTX 4060 8GB、32GB RAM、ComfyUI 0.30.0 與 PyTorch 2.13.0+cu130。正式跑通的路徑使用官方 int8 convrot DiT、NVFP4/AWQ 文字編碼器、官方 video/audio VAE,並開啟 lowvram、關閉即時預覽。
第一次測試採 608×352、56 幀、4 steps,約 266.59 秒後在取樣階段發生 CUDA OOM。當時文字編碼器、VAE 與 H3 模型大量卸載到系統記憶體,實體 RAM 一度來到約 31.60GB,已經沒有舒服的緩衝空間。
我們也試過 DiffSynth-Studio 的 NF4 路線。模型能進入運算,但 Windows 磁碟卸載碰到 mmap 競態問題;停用檔案刷新後,記憶體又快速上升。另一路社群 GGUF 可以產出 H.264 與 AAC 檔案,低步數結果卻有明顯人物變形與殘影,來源模型當時也未標示清楚授權,因此沒有把它列為正式商業建議。
| 實測項目 | 尺寸/幀數 | Sampling | 總時間與判斷 |
|---|---|---|---|
| Spectrum 相容性 | 480×832/124 幀 | 5 分 04 秒 | 7 分 59 秒,通過 H.264 + AAC 檢查 |
| 原生品質基線 | 704×1280/124 幀 | 27 分 30 秒 | 31 分 40 秒,成功完成 |
| Spectrum A 段 | 704×1280/124 幀 | 18 分 54 秒 | 23 分 22 秒,sampling 快 31.3% |
| Spectrum B 段 | 704×1280/124 幀 | 18 分 46 秒 | 23 分 20 秒,第二次結果可重複 |
最終 10 秒測試沒有硬撐單次長生成。我們把兩個約 5 秒的 124 幀片段接起來,移除第二段重複首幀,得到 243 幀、24 fps、10.125 秒的成品;原始尺寸為 704×1280,再用 Lanczos 放大到 720×1280。這個做法增加了接縫與音訊淡接的後製,換來的是比較可控的記憶體風險。
哪一套 Windows 工作流最後真的跑成功?
能重複跑完的組合,比最新套件更有價值。我們保留一套獨立 ComfyUI,不和日常生圖環境混用,並固定 Spectrum v0.1.4、官方量化元件與推理設定。生成期間不更新 ComfyUI、PyTorch 或模型節點,新版本先複製到另一套環境做短片測試。
8GB 顯卡上,我們會保留的六個設定
- 先做 5 秒:正式 10 秒內容拆成兩段,再用動作方向、構圖與音訊接點把鏡頭接起來。
- 鎖住版本:把能完成的 ComfyUI、PyTorch、節點與模型 revision 記錄下來,專案中途不追新。
- 獨立環境:H3 使用自己的安裝目錄,避免常用節點更新後連帶破壞工作流。
- 分頁檔自動管理:32GB RAM 已接近下限,Windows 需要足夠的虛擬記憶體空間。
- 生成時清場:瀏覽器大量分頁、剪輯軟體與其他 AI 模型先關閉,為 VAE 解碼和卸載留出空間。
- 加速器一次選一套:Spectrum 不和 EasyCache、SageAttention 疊加,出了畫面問題才知道該查哪一層。
官方與社群的進展很快。MiniMax 已公開討論 ComfyUI 的量化、卸載與消費級 GPU 部署,也分享社群為 Apple Silicon 製作的原生 h3.c 推理引擎。另一條 Sol Engine 路線則公布多張 NVIDIA GB200 的加速數據。這些動態證明本地生態正在成熟,卻不能拿多 GPU 伺服器的速度推算 RTX 4060;硬體規模、解析度、幀數與框架都不同。
珍珠娛樂實測後,商業團隊該怎麼評估?
本地生成的價值很實際:未公開的概念圖、腳本方向與品牌素材可以留在自己的工作站,反覆測試不必逐次等待雲端排程。代價也同樣具體,包含模型下載、環境維護、長時間運算、失敗重跑,以及後續剪輯與人工審稿。
| 工作情境 | 目前建議 | 原因 |
|---|---|---|
| 提案前的動態概念預演 | 適合納入 | 能快速確認鏡頭氣氛、動作方向與視覺語言 |
| 社群短片的局部生成鏡頭 | 可用,需人工剪輯 | 短段落比較容易控制,成品仍要檢查人物、文字與轉場 |
| Logo 或包裝的動態測試 | 適合做草案 | 可先看節奏與構圖,不應用生成結果取代精準的品牌動態規範 |
| 品牌年度主片 | 不建議直接交付 | 跨鏡頭一致性、人物表演與授權審查仍需要完整製作流程 |
| 精準產品示範 | 優先真人拍攝或 3D | 產品結構、操作步驟與文字資訊不能容忍模型自行補畫 |
| 長鏡頭人物演出 | 先做測試,不承諾直接成片 | 社群近期仍回報轉場、聲線與長動作控制不穩 |
如果正在比較雲端與本地工具,可延伸閱讀 Runway 與 Pika 的 AI 影片工具比較。想把畫面放進採購決策流程,則可從 B2B 企業如何用影片說服採購決策者 開始。公開 AI 素材前,也建議同步查看 AI 生成圖片透明揭露指南,別讓工具選擇跑在授權與交件規則前面。
我們現階段會把 MiniMax-H3 放在「可用的研發工具」,不把它包裝成一鍵成片機器。當品牌需要的是正確產品、可信人物與可持續使用的素材,真人拍攝、設計判斷、生成工具與後製都要回到同一張製作表上。
常見問題 FAQ
可以。我們在 Windows、RTX 4060 8GB 與 32GB RAM 上完成 480×832 和 704×1280 測試,但必須使用量化元件、lowvram、分段生成與足夠的分頁檔。這不代表所有安裝組合都能直接成功。
32GB 能完成我們的測試,運行時卻很接近記憶體上限。若準備長期使用,64GB 會是比更換顯卡更先改善的環節之一;32GB 環境至少要保留 Windows 自動管理分頁檔,並關閉其他大型程式。
從獨立環境、固定版本和短片工作流開始。先用低解析度確認模型、VAE、音訊與輸出節點都能走完,再提高到正式尺寸;不要同時疊加多套快取或注意力加速,否則品質或記憶體出問題時很難定位。
不能只用「模型可下載」判斷。現行 MiniMax H3 Community License 有適用地區、公開揭露與商業產品要求,輸入素材也可能涉及肖像、商標及著作權。正式商用前要核對最新條款、實際投放地區與素材權利;高風險專案應交由法務確認。
你的 AI 影片,是要驗證想法,還是準備正式對外?
兩種任務需要的畫質、授權紀錄與製作流程差很多。先確認影片要說服誰、會用在哪裡,再決定哪些鏡頭適合生成、哪些應回到真人拍攝與精準後製。
參考資料:
1. MiniMax, MiniMax-H3 official repository and model documentation, accessed 2026-08-12.
2. MiniMax, MiniMax H3 Community License Agreement, released 2026-08-02, accessed 2026-08-12.
3. MiniMax, Official AMA recap and Apache-2.0 transition note, 2026-08-09.
4. MiniMax, ComfyUI consumer-GPU deployment discussion, 2026-08-10.
5. MiniMax, Community h3.c inference engine for Apple Silicon, 2026-08-11.
6. MiniMax, Sol Engine acceleration discussion, 2026-08-11.
7. 珍珠娛樂團隊,MiniMax H3 Spectrum Windows 實測紀錄,2026-08-06。

