硬體與本地大模型

DGX Spark+MiniMax H3:快速打造中小企業的 AI 短影音平台

用一台 128GB 的 NVIDIA DGX Spark,裝上開源的影片模型 MiniMax H3,再配上 ComfyUI 和 AI Agent,中小企業可以在自己公司把商品照做成有聲的短影音。做法分五步:選工具、準備環境、跑出第一段影片、交給 AI Agent 生成和剪輯、把結果調到能用。本文是奧微軟體 AugurSoft「AI 策略室」同名影片的文字版,影片可以直接在上方觀看。片中說會放在文章裡的模型清單、安裝檢查清單、官方範本、生成和剪輯的任務文字、分鏡範本與常見問題,都整理在下面。

影片章節

時間章節這段講什麼
0:00開場H3 官方有聲成果,和這支影片要帶你做的事
0:39先看效果MiniMax H3 的三種給法:只給文字、給開頭結尾畫面、給參考素材
2:14第一步|工具怎麼選線上服務、Wan 2.2、LTX-2、H3 怎麼選;四個角色各做什麼
4:46第二步|機器上要準備什麼三樣東西,和裝好後該看到的五個畫面
6:47第三步|跑出第一段影片官方圖生影片範本、提示詞寫法、要等多久
9:30第四步|讓 AI Agent 幫你生成和剪輯MCP、兩段任務文字、資料怎麼走
11:50第五步|把結果調到能用商品變形、動作不對、字跑掉、聲音不對,以及三鏡分鏡
13:55帶走整套做法可以帶走的清單、商用授權、奧微可以協助的事

MiniMax H3 能做什麼?

MiniMax H3 是 MiniMax 開源的影片模型,最大的不同是畫面和聲音一起生成:人講話、環境音、配樂,都在同一次生成裡出來,不用另外配。它有三種給法:

給法你要準備的官方名稱
只給文字一段文字描述T2VA(文字生成有聲影片)
給開頭、結尾的畫面文字,加一張開頭畫面;也可以再給一張結尾畫面,中間的動作和聲音由它補上FL2VA(首尾畫面生成有聲影片)
給參考素材文字,加參考圖片、影片或聲音;一次最多 9 張圖、3 段影片和 3 段聲音,寫清楚誰要說什麼,畫面裡的人就照著開口Ref2VA(參考生成有聲影片)

開源版預設輸出的短邊是 768 像素,每段 4 到 15 秒,每秒 24 格,聲音是 32 kHz 立體聲。官方的 2K 版本要走 MiniMax 的雲端服務。示範影片和完整規格在 MiniMax H3 官方 GitHub。

做影片的 AI 工具怎麼選?

做影片的 AI 很多,不用比參數,只比四件看得見的事:有沒有聲音、能不能指定開頭和結尾的畫面、能不能拿參考素材控制,還有它在哪裡跑。

選項特點要注意
線上影片生成服務打開網頁就能用,畫質也好素材要上傳到別人的伺服器;用得越多費用越高;能做什麼由平台決定
Wan 2.2開源,能裝在自己機器上;畫面控制成熟,現成的工作流很多主打畫面,聲音要另外處理
LTX-2 系列開源,能裝在自己機器上;聲音和畫面一起生成,蒸餾版適合快速試不同版本本文以 H3 為主線,LTX-2 的做法見 ComfyUI 官方文件
MiniMax H3開源,可以放在自己公司的機器上;聲音畫面一起出來、能指定開頭結尾、能用參考素材開源版預設輸出的短邊是 768 像素,每段 4 到 15 秒;官方的 2K 版本要走 MiniMax 的雲端服務
  • 需要聲音、要控制開頭結尾的畫面,又想把素材留在公司:用 H3。
  • 只想快速試很多版本:可以看 LTX-2 系列。
  • 手上已經有 Wan 的工作流:可以繼續用(ComfyUI 的 Wan 2.2 文件)。

DGX Spark、H3、ComfyUI、AI Agent 各做什麼?

這套做法裡有四個角色,先分清楚:

名稱角色負責什麼
DGX Spark機器NVIDIA 做的桌上型 AI 電腦。本文用的是 128GB 統一記憶體的版本,15 公分見方、1.2 公斤,放在辦公室桌上就能用
MiniMax H3引擎生成影片和聲音
ComfyUI工作台用一個個方塊連線,把生成步驟排成流程
AI Agent助理像 Codex 或 Claude。你用一句話交代,它去操作工作台,還能幫你剪片

為什麼要 128GB?這套社群配方光是下載的模型檔就約 42.5GB,執行時還需要額外的記憶體。DGX Spark 的 128GB 統一記憶體由 CPU 和 GPU 共用,讓大型影片模型有更大的運作空間。這台機器的規格與定位,可以看什麼是 NVIDIA DGX Spark。

模型清單:要下載哪些檔案?

社群作者 Xplore-LAB 在單台 DGX Spark 上跑通的,是一套量化過的組合。量化就是把模型壓小一點,讓它放得進這台機器,畫質會有一點取捨。這是作者測過的基本組合:

用途模型檔案大小
主模型MiniMax H3 FL2VA pruned INT8 convrot(文字生成、首尾畫面生成)21.0 GB
文字編碼器Qwen3-VL-32B NVFP4 AWQ(負責看懂提示詞)15.7 GB
影像解碼器H3 Video VAE,FP16(把畫面還原出來)5.21 GB
聲音解碼器H3 Audio VAE,FP32(把聲音還原出來)0.605 GB
合計4 個檔約 42.5 GB

用 ComfyUI 官方範本時,再依範本補齊對應的檔案。官方文件列出的檔名和資料夾如下;要用參考生成,還要再加一個參考生成專用的主模型。官方另外提供 bf16 版本的主模型,需要更多記憶體。模型檔放在 Hugging Face 的 Comfy-Org/MiniMax-H3,完整清單以 ComfyUI 的 H3 本地範本文件為準。

檔名放在哪個資料夾用在哪裡
minimax_h3_fl2va_pruned_int8_convrot.safetensorsComfyUI/models/diffusion_models/文字生成、圖生影片的主模型
minimax_h3_ref2va_pruned_int8_convrot.safetensorsComfyUI/models/diffusion_models/參考生成專用的主模型
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensorsComfyUI/models/text_encoders/三種範本共用的文字編碼器
minimax_h3_video_vae_int8_convrot.safetensorsComfyUI/models/vae/三種範本共用的影像解碼器
minimax_h3_audio_vae_fp32.safetensorsComfyUI/models/vae/三種範本共用的聲音解碼器
minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16.safetensorsComfyUI/models/loras/文字生成、圖生影片的加速 LoRA(turbo,8 步)
minimax_h3_ref2v_turbo_4step_v0.1_comfyui_bf16.safetensorsComfyUI/models/loras/參考生成的加速 LoRA(turbo,4 步)
minimaxh3_art_is_explosion.safetensorsComfyUI/models/embeddings/官方範本的模型存放清單有列出

H3 負責生成鏡頭。要組成一支完整的短影音,常會再搭配這些工具,依需要再裝:

用途可以搭配的工具
商品圖、分鏡草圖Qwen-Image、FLUX.2 Klein
固定的中文旁白Qwen3-TTS
字幕時間軸faster-whisper
剪接、上字幕、配樂、疊 LogoFFmpeg

機器上要準備什麼?

其實就三樣:

  1. ComfyUI 工作台。H3 的文字生成、圖生影片、參考生成三個基本範本,需要 ComfyUI 0.30.0 以上。
  2. H3 的模型檔。就是上面那份清單。
  3. ComfyUI 官方的本地 MCP(comfy-mcp)。讓 AI Agent 接得上工作台。

這一段的安裝和設定,奧微軟體可以幫你做好,你不用自己下指令,只要知道裝好以後應該看到哪五個畫面。自己裝和請人裝差在哪,可以看買了 DGX Spark 怎麼裝。想自己動手的話,兩份來源的步驟整理如下。

安裝 ComfyUI 與 H3:社群作者的步驟

Xplore-LAB 的安裝紀錄把 ComfyUI 和 H3 裝在容器裡,共五步,指令照原文:

  1. 準備 ComfyUI 原始碼(v0.30.0)。
  2. 初始化與檢查,確認容器看得到這台機器的 GPU。
  3. 建置、下載模型、啟動。
  4. 編譯 torchaudio 並存進映像檔。H3 的聲音解碼器需要 torchaudio,作者說明必須從原始碼編譯,編好後用 docker commit 存起來,否則容器重建就不見了。編譯指令見原文第 4 節。
  5. 生成第一段影片。
# 1. 準備 ComfyUI 原始碼
./scripts/prepare_comfyui_src.sh

# 2. 初始化與檢查
make init DATA_ROOT=/mnt/<你的NVMe>/minimax-h3
make preflight
make gpu-check     # 應顯示 torch.cuda.is_available() = True, GPU: NVIDIA GB10

# 3. 建置、下載模型、啟動
make build
make download      # 只下載 4 個必需檔,42.5 GB,可續傳
make verify-models
make up && make logs
curl http://127.0.0.1:8188/system_stats   # 回 200

作者另外提醒兩件事:生成影片時不要同時跑其他大模型,統一記憶體會被用滿;工作台只開在公司內網,或用加密連線(SSH 通道)進去,不要直接開到網路上。

安裝本地 MCP:ComfyUI 官方的步驟

ComfyUI 官方的 MCP 文件列出的前提有四個:Python 3.10 以上、comfy-cli 1.14.0 以上、一個 ComfyUI 工作區,以及正在執行的 ComfyUI(MCP 不會自動幫你啟動)。

pip install "comfy-cli>=1.14.0"
comfy install            # 已經有 ComfyUI 的話,改用 comfy set-default <路徑>
pip install comfy-mcp
comfy launch

# 把 comfy-mcp 加進 Claude Code
claude mcp add comfy-mcp -e COMFY_BIN=/path/to/venv/bin/comfy -- comfy-mcp

comfy-mcp 是跑在本機的服務,要裝在看得到 ComfyUI 工作區的那台機器上。所以 Agent 的命令列工具是在 DGX Spark 上執行,或用 SSH 登入後執行。Codex 等其他支援 MCP 的工具,照各自的設定方式加入 comfy-mcp 這個指令。社群配方把 ComfyUI 放在容器裡,comfy-mcp 要對到同一個工作區,實際路徑照機器上的配置設定。

安裝檢查清單:裝好後應該看到哪五個畫面?

不管是自己裝還是請人裝,這五項都過了,環境就準備好了。

檢查項目怎麼確認
1. ComfyUI 跑起來了在瀏覽器打開工作台的網址,看得到工作台。社群配方的確認方式:啟動紀錄出現 To see the GUI go to: http://0.0.0.0:8188,curl http://127.0.0.1:8188/system_stats 回 200
2. 模型都到位範本需要的檔案都下載完、通過檢查(社群配方用 make verify-models),放在對的資料夾
3. 官方範本載得起來ComfyUI 的版本要夠新才有 H3 的範本(基本範本要 0.30.0 以上),打開來不能有缺少的節點
4. 先跑一段小的試試看社群作者的完成標準:608×352、736×416、864×480 三種尺寸接連生成成功,而且輸出同時有畫面和聲音
5. AI Agent 接得上請 Agent 呼叫 MCP 的第一個工具 server_info,它回報得出 ComfyUI 有沒有在跑、在哪一台、用哪個工作區

怎麼跑出第一段影片?

用商品廣告當例子。ComfyUI 官方的 H3 圖生影片範本附了一個示範:一張透明電競滑鼠的商品照。打開這個範本,要填的地方其實不多:

  1. 放開頭畫面,也就是商品照;想控制結尾,再放一張結尾畫面。
  2. 寫提示詞。H3 的提示詞要同時寫畫面和聲音:畫面寫鏡頭怎麼動、東西怎麼動,例如鏡頭慢慢繞著滑鼠轉、燈光從藍色變成橘色;聲音寫你想聽到什麼,例如清脆的按鍵聲,加上低沉的電子配樂。
  3. 設定畫面比例和尺寸。
  4. 選步數。生成要跑好幾步,每一步把畫面修得更清楚一點,步數越多越慢。範本預設 20 步;裝好加速用的 LoRA 後打開 turbo,用 8 步先看結果,再依需要切回一般模式。
  5. 按執行。跑完的畫面和聲音會存成同一個 MP4。

官方範本跑出來的成果,5 秒裡面換了好幾個鏡頭:一段生成,就可以有好幾個鏡頭。

提示詞怎麼寫?

MiniMax 官方 GitHub 的示範提示詞,寫法很值得學。它分成三段:畫面照鏡頭分段,每一鏡先寫景別和運鏡,例如中遠景、慢慢推近;聲音分兩部分寫,一部分是畫面裡真的會發出的聲音,像引擎聲、腳步聲,另一部分是另外加上去的配樂。下面是官方文字生成示範每一段的開頭:

integrated_multimodal_description: [Shot 1] Cinematic, medium wide shot, pushing in slowly. In the cavernous, dimly lit bridge of a starship, …
overall_soundscape: A low, resonant hum of the ship's ambient life support systems serves as the baseline, …
non_diegetic_music: Cinematic space-opera orchestral score, slow tempo, …
  • integrated_multimodal_description:畫面。用 [Shot 1]、[Shot 2] 分鏡,每一鏡先寫景別和運鏡,再寫畫面裡有什麼、怎麼動。
  • overall_soundscape:畫面裡真的會發出的聲音。
  • non_diegetic_music:另外加上去的配樂。

生成一段影片要等多久?

看社群作者 Xplore-LAB 在 DGX Spark 上的實測(2026 年 8 月 4 日):

測試解析度長度耗時
最小的測試608×3524 秒96.8 秒
一般736×4165 秒179.9 秒
平常用864×4805 秒255.8 秒(20 步)
直式圖生影片768×11525 秒15 分 22 秒
多段接成長片8 段各 5 秒,接成 40 秒—約 50 分鐘(含合成拼接)

作者也提醒,時間大約跟畫格數和解析度成正比,直式和高解析度會明顯變慢。

另外,NVIDIA 的研究團隊發表過一個叫 Sol-H3 的做法:先用 H3 快速出草稿,再交給另一個模型把畫質修上去。模型已載入的情況下,從輸入提示詞到拿到 5 秒、768p 有聲影片,參考紀錄大約 56 秒;常駐記憶體約 116.9 GiB,幾乎用滿整台機器。

怎麼讓 AI Agent 幫你生成和剪輯?

前面那些步驟,每做一支都要重來一次:開範本、換圖、改提示詞、調尺寸、按執行、等它跑完,再去資料夾找檔案。交給 Agent 以後,你只要給一段任務文字。

Agent 靠 MCP 操作 ComfyUI。MCP 是一種讓 AI 使用工具的接口;ComfyUI 官方的本地 MCP 裝在同一台機器上,Agent 會拿到一組工具,照順序一步一步做。下面是官方文件列出的重點工具,你不用記,知道它在做什麼就好:

工具做什麼
server_info確認本機的 ComfyUI 有沒有在跑、在哪一台、用哪個工作區。官方說明要先呼叫這一個
search_templates/fetch_template找內建範本,取出可以執行的工作流
search_models列出機器上有哪些模型檔
search_nodes/get_node/list_nodes查這台機器實際裝了哪些節點
validate_workflow正式跑之前,先檢查工作流和參數有沒有填對
run_workflow把工作流送出去跑
job_status/wait_for_job/watch_job查進度、等它跑完
fetch_outputs把跑完的影片複製到指定的資料夾
launch_comfyui/stop_comfyui啟動或停止本機的 ComfyUI

生成任務文字

片中示範的是一句話的版本:「用這張商品照,生成三段 5 秒的影片,每段換一個 seed,跑完把影片放到交付資料夾。」seed 是隨機的起點,換一個就是另一個版本。下面是補上素材、檢查點和回報內容的完整版,【】裡換成你的內容就能用:

請用這台機器上的 ComfyUI 幫我生成商品短片。

素材:
- 商品照:【商品照的檔案路徑】(當開頭畫面)
- 結尾畫面:【檔案路徑;沒有就略過】

要做的事:
1. 先用 server_info 確認 ComfyUI 有在跑,回報是哪一台、哪個工作區。
2. 用 search_templates 找 MiniMax H3 的圖生影片範本,取出可以執行的工作流。
3. 用 search_models 確認範本需要的模型檔都在;缺檔就停下來告訴我缺哪些,不要自己下載。
4. 放入商品照和下面的提示詞;尺寸【864×480】,長度【5】秒。
5. 送出前先用 validate_workflow 檢查,有錯先回報。
6. 生成三段,每段換一個 seed;送出後盯著進度到跑完。
7. 用 fetch_outputs 把三段影片放到【交付資料夾路徑】,檔名標上 seed。

提示詞:
【貼上這一鏡的提示詞】

做完請列出:三段的檔名、seed、尺寸、各花了多久;失敗的也列出原因。

剪輯任務文字

生成完,剪輯也交給它。片中的一句話版本是:「把這三段剪成一支 15 秒的短影音,配上字幕和音樂,最後 2 秒放公司的 Logo。」完整版如下:

請把【交付資料夾路徑】裡的三段影片剪成一支 15 秒的短影音。

要做的事:
1. 依【第一鏡、第二鏡、第三鏡】的順序接起來,每段 5 秒。
2. 加上字幕:【每一段要上的字】,字的大小要在手機上看得清楚。
3. 配樂用【音樂檔路徑】;原本生成的聲音【保留/靜音】,配樂不要蓋過商品的聲音。
4. 最後 2 秒放公司 Logo:【Logo 檔路徑】。疊上真的 Logo 檔,不要用生成的。
5. 輸出【橫式 16:9/直式 9:16】的 MP4,放回交付資料夾。直式版請用直式生成的片段,不要從橫式裁。

做完請列出:成品檔名、長度、解析度,以及用了哪些素材。

你要做的就是看成品。哪裡不滿意,例如字幕太小、音樂太吵,再用一句話叫它改:「字幕放大一點」「音樂小聲一點」「Logo 晚一秒出現」。同一個商品,也可以叫它多做一個版本,例如給 Reels 的直式、給 YouTube 的橫式。直式最好在生成時就用直式跑,不要從橫式硬裁,商品才不會被切掉;直式比較慢,上面的實測數字也看得到。

資料怎麼走?

影片是在你自己的機器上生成的。但 Agent 如果用的是雲端的模型,你打的任務文字,還有它讀到的檔案資訊,可能會送到雲端。

哪些事還是要人把關?

目前有三件:商品長得對不對、字幕有沒有錯字、聲音有沒有怪聲。Agent 幫你省掉的是重複的操作,最後的判斷還是你。

生成結果不能用,怎麼調?

第一次生成的結果,常常不能直接用。最常見的是下面幾種狀況:

狀況解法
商品變形:形狀歪了、零件不見了把限制給清楚。開頭放商品照(first_frame),結尾也放一張你要的最後畫面(last_frame);提示詞把形狀、材質、顏色寫清楚
動作不對:要鏡頭繞著商品轉,它卻讓商品自己飛起來先把動詞寫得更具體,再換幾個 seed,一次多生幾版,從裡面挑最好的。挑片本來就是製作的一部分
商品上的字或 Logo 跑掉不要硬逼模型寫字。生成時讓畫面保持乾淨,字和 Logo 在剪輯時疊上真的檔案,最準
聲音不對:配樂太大聲,蓋過了按鍵聲提示詞把現場聲音和配樂分開描述。配樂還是不合適,可以重新生成,或把原音軌靜音,另外加音效和音樂

商品廣告的三鏡分鏡與提示詞範本

上面的問題處理好,就能組一支商品廣告。最簡單的是三個鏡頭,三段各 5 秒,接起來就是 15 秒的短影音:

鏡頭畫面聲音以滑鼠為例
第一鏡特寫商品的質感環境音滑鼠放在黑色桌面,鏡頭從上方慢慢推近,燈光掃過透明外殼;聲音是低沉的電子音
第二鏡有人在用操作的聲音一隻手握住滑鼠快速點擊,聽得到清脆的按鍵聲
第三鏡收在商品和 Logo,加一句標語收尾的聲音滑鼠停在畫面中央,燈光慢慢變暗,留出放 Logo 的空間

下面是每一鏡的提示詞範本,照 MiniMax 官方示範提示詞的三段格式寫。官方示範用英文,範本也用英文。每一鏡各生成一次,開頭畫面放你的商品照;【】裡是滑鼠的例子,換成你的商品,送出前把【】符號拿掉。配樂如果打算在剪輯時另外加,non_diegetic_music 那一行就寫明不要配樂。

第一鏡:特寫商品的質感

integrated_multimodal_description: [Shot 1] Product commercial, extreme close-up, camera slowly pushing in from above. 【A transparent RGB gaming mouse】 rests on 【a matte black desk】. A soft beam of light sweeps across 【its clear plastic shell】, revealing 【the circuit board and glowing LEDs inside】. The product stays still and keeps its exact shape, proportions and color.
overall_soundscape: 【A low electronic hum and faint room tone】.
non_diegetic_music: 【Minimal, slow ambient synth pad, very quiet】.

第二鏡:有人在用

integrated_multimodal_description: [Shot 1] Product commercial, medium close-up, static camera at desk level. A hand grips 【the transparent RGB gaming mouse】 and clicks rapidly; 【the RGB lights pulse with each click】. The product keeps its exact shape, proportions and color.
overall_soundscape: 【Crisp, rapid mouse clicks】 and light desk contact sounds.
non_diegetic_music: 【Minimal ambient synth pad, very quiet】.

第三鏡:收在商品,留位置給 Logo

integrated_multimodal_description: [Shot 1] Product commercial, centered hero shot, static camera. 【The transparent RGB gaming mouse】 sits in the center of the frame on 【a matte black desk】. The lighting slowly dims, leaving clean, dark empty space in 【the upper left】 of the frame. No text, no logo and no watermark anywhere in the frame.
overall_soundscape: 【The low electronic hum slowly fades out】.
non_diegetic_music: 【The synth pad resolves on a single soft note】.

標語和 Logo 不寫進提示詞,在剪輯時疊上去。

商用之前,要看哪些授權條款?

H3 用的是 MiniMax 的社群授權(MiniMax H3 Community License Agreement)。重點有三個:

  • 適用地區:台灣在適用地區內。條款排除的地區是歐盟、英國、韓國和美國。
  • 營收門檻:商業產品與服務的年營收不超過 2,000 萬美元,可以依社群授權商用;超過的話,要先取得 MiniMax 的書面授權。
  • 標示:使用 H3 的商業產品或服務,要在使用者介面上清楚標示「MiniMax H3」。

相關條款的原文如下,其他條款也要遵守,完整內容請看授權條款原文。

“Excluded Territories” means the European Union, the United Kingdom, the Republic of Korea and the United States of America.
IV. Additional Commercial Terms
1. You shall obtain a separate, prior written authorization from MiniMax by contacting api@minimax.io with the subject line “MiniMax H3 licensing - authorization request”, if your commercial products and services generate more than 20 million US dollars (or equivalent in other currencies) in yearly revenue.
2. You shall prominently display “MiniMax H3”on the user interface of commercial product or service that uses MiniMax H3 or MiniMax H3 Works.

想在公司放一台 DGX Spark 做短影音,奧微可以協助什麼?

奧微軟體 AugurSoft 可以協助三件事:機器的安裝和設定;把你的商品照和品牌素材整理成範本;再把生成和剪輯的流程接好,讓同事用一句話就能交代 Agent 做影片。想了解可以看奧微的 DGX Spark 方案,或直接到 LINE 官方帳號 聊聊你的商品和需求。

常見問題

DGX Spark 128GB 能跑哪些影片模型?該怎麼選?

有公開紀錄的是兩種:社群作者在單台 DGX Spark 上跑通的 MiniMax H3 量化組合(模型檔約 42.5GB),以及 NVIDIA 研究團隊的 Sol-H3(常駐記憶體約 116.9 GiB,幾乎用滿整台機器)。Wan 2.2 和 LTX-2 也是能裝在自己機器上的開源模型,ComfyUI 有官方工作流。需要聲音、要指定開頭結尾的畫面、又想把素材留在公司,用 H3;只想快速試很多版本,看 LTX-2 系列;手上已經有 Wan 的工作流,可以繼續用。

生成出來的商品變形,或商品上的字、Logo 跑掉,怎麼辦?

商品變形時把限制給清楚:開頭放商品照,結尾也放一張你要的最後畫面,提示詞把形狀、材質、顏色寫清楚。字和 Logo 不要硬逼模型寫:生成時讓畫面保持乾淨,剪輯時再疊上真的文字和 Logo 檔。

在自己的機器上生成,資料還會送出公司嗎?

影片是在你自己的機器上生成的,商品照和成品留在機器上。但 AI Agent 如果用的是雲端的模型,你打的任務文字,還有它讀到的檔案資訊,可能會送到雲端。

生成一段影片要等多久?

看社群作者在 DGX Spark 上的實測:608×352、4 秒約 96.8 秒;864×480、5 秒、20 步約 255.8 秒;直式 768×1152、5 秒的圖生影片是 15 分 22 秒。時間大約跟畫格數和解析度成正比,直式和高解析度會明顯變慢。NVIDIA 研究團隊的 Sol-H3 在模型已載入時,從輸入提示詞到拿到 5 秒、768p 有聲影片的參考紀錄約 56 秒。

生成的片段怎麼組成一支短影音?

最簡單的是三個鏡頭:第一鏡特寫商品的質感,第二鏡有人在用,第三鏡收在商品和 Logo。三段各 5 秒,接起來就是 15 秒。剪接、字幕、配樂和 Logo 可以用一段任務文字交給 AI Agent 處理,你看成品,哪裡不滿意再用一句話叫它改。

MiniMax H3 生成的影片可以商用嗎?

H3 用的是 MiniMax 的社群授權。台灣在適用地區內;商業產品與服務的年營收不超過 2,000 萬美元,可以依社群授權商用;超過要先取得 MiniMax 的書面授權。其他條款也要遵守,請以授權條款原文為準。

資料來源

回文章列表