목적별 H3 워크플로
시작 구도를 고정하려면 이미지 투 비디오를 쓰고 끝 구도도 제어할 때 선택 종료 프레임을 추가하세요. 정체성, 움직임 또는 사운드를 자산에서 전달할 때는 레퍼런스 투 비디오를 쓰고 768P 또는 2K를 직접 선택하세요.
텍스트, 시작·종료 프레임 또는 멀티모달 레퍼런스로 네이티브 스테레오 오디오가 포함된 4–15초 MiniMax H3 영상을 생성하세요.
모드를 선택하고 필요한 미디어와 연출 지시를 추가해 동영상을 생성하세요.
MiniMax H3는 텍스트, 이미지, 비디오, 오디오 맥락을 네이티브 스테레오 사운드가 포함된 일관된 AI 비디오로 결합합니다. 4–15초 숏, 시작과 종료 프레임, 멀티모달 레퍼런스와 배포 화면비를 설계하고 하나의 시청각 아이디어를 완성된 시퀀스로 이어가세요.
연속성, 퍼포먼스, 대사, 공간음과 음악을 하나로 묶는 멀티모달 브리프

MiniMax H3는 텍스트, 이미지, 비디오, 오디오를 이해하고 네이티브 스테레오 사운드가 포함된 영상을 출력하는 옴니모달 생성 시스템입니다. 텍스트 투 비디오, 필수 시작 프레임과 선택 종료 프레임을 쓰는 이미지 투 비디오, 대규모 멀티모달 레퍼런스 투 비디오를 제공합니다.
제작 관점의 핵심은 하나의 시청각 브리프입니다. 인물 정체성, 구도, 레퍼런스 움직임, 대사, 공간음과 음악을 같은 4–15초 시퀀스 안에서 설계할 수 있습니다.
시작 구도를 고정하려면 이미지 투 비디오를 쓰고 끝 구도도 제어할 때 선택 종료 프레임을 추가하세요. 정체성, 움직임 또는 사운드를 자산에서 전달할 때는 레퍼런스 투 비디오를 쓰고 768P 또는 2K를 직접 선택하세요.
가로, 정사각형, 세로 비율이 영화, 상품 페이지, 피드, 세로형 SNS를 지원합니다. 출력은 24 fps 비디오와 네이티브 32 kHz 스테레오 오디오입니다.
길이, 프레임, 레퍼런스, 화면비, 소리와 언어를 하나의 제작 브리프 안에서 연결합니다.
소셜 훅, 제품 공개, 대화, 퍼포먼스나 연결 숏에 맞춰 고정 길이 대신 목적에 알맞은 시간을 선택합니다.
문서화된 제한 안에서 이미지 9개, 비디오 3개, 오디오 3개, 혼합 파일 총 12개까지 구성할 수 있습니다.
이미지 투 비디오는 시작 프레임이 필수이고 종료 프레임은 선택입니다. 영상의 출발점을 고정하고 필요할 때 최종 구도도 명확히 정합니다.
21:9, 16:9, 4:3, 1:1, 3:4, 9:16이 와이드, 정사각형, 세로 배포 화면을 지원합니다.
대사, 공간음, 효과음과 음악을 화면과 함께 32 kHz 스테레오로 생성하고 시간축에서 진입 시점과 강도를 연출합니다.
한국어, 중국어, 영어, 일본어, 프랑스어, 독일어 등 11개의 안정적인 대화 언어가 글로벌 시청각 제작을 지원합니다.
스틸 이미지는 정체성과 디자인, 비디오는 움직임, 오디오는 연기와 리듬을 담당하고 프롬프트가 시간축에서 모두 연결합니다.

제품 이미지로 실루엣과 재질을 유지하고 영상으로 공개 동작을 안내하며 타이밍이 지정된 사운드로 디테일과 마지막 브랜드 비트를 강조합니다.

얼굴, 의상, 환경을 고정하고 대사와 룸톤을 정의한 뒤 시선, 반응 타이밍, 카메라 거리와 마지막 프레임을 연출합니다.

레퍼런스 비디오로 몸의 리듬을 제어하고 이미지로 인물과 스타일을 정의한 뒤 음악 방향, 9:16, 읽기 쉬운 마지막 홀드를 추가합니다.
배포 포맷을 정하고 올바른 H3 입력 구조를 선택한 다음 각 레퍼런스에 하나의 역할을 부여하고 화면과 소리를 같은 시간축에서 연출합니다.
4–15초와 실제 배포 비율을 고르고 시작 동작, 전환점, 마지막 1초에 보여주고 들려줄 것을 명확히 합니다.
구도 중심 숏은 텍스트와 시작·종료 프레임을, 정체성, 실제 움직임, 말투, 사운드 방향을 옮길 때는 멀티모달 레퍼런스를 사용합니다.
이미지는 인물 또는 환경, 비디오는 움직임, 오디오는 목소리 또는 템포로 표기하고 충돌하는 소재를 제거합니다.
정체성, 접촉 물리, 카메라 동기, 입 모양, 대사, 공간음, 음악과 마지막 프레임을 확인한 후 768P 또는 2K 결과를 내려받아 편집합니다.
H3는 기존 텍스트·이미지 비디오 생성에서 옴니모달 레퍼런스와 네이티브 시청각 출력으로 MiniMax 워크플로를 확장합니다.
| 워크플로 | MiniMax H3 | Hailuo 2.3 | 제작 효과 |
|---|---|---|---|
| 클립 길이 | 4–15초 | 설정에 따라 6초 또는 10초 | H3는 짧은 서사와 광고 장면에 더 넓은 시간 범위를 제공합니다. |
| 입력 구조 | 텍스트, 시작·종료 프레임, 이미지·비디오·오디오 레퍼런스 | 텍스트 투 비디오와 이미지 투 비디오 | 정체성, 움직임, 퍼포먼스와 사운드를 개별 소스로 표현합니다. |
| 오디오 출력 | 네이티브 32 kHz 스테레오 | 비디오 생성 워크플로 | H3는 화면과 소리를 한 시퀀스로 연출합니다. |
| 해상도 | 768P 또는 2K 직접 출력 | 768p 또는 1080p 설정 | MiniMax H3 생성 요청에서 출력 해상도를 직접 선택합니다. |
멀티모달 시청각 연출에는 H3, 확립된 텍스트·이미지 비디오 설정에는 Hailuo 2.3을 선택하세요.
화면의 사건, 레퍼런스 역할, 카메라, 대사, 공간음, 효과음, 음악과 마지막 프레임을 작성합니다.
스타일 표현보다 먼저 길이, 화면비, 플랫폼, 시청자와 숏의 목적을 적습니다.
어떤 이미지가 정체성, 비디오가 움직임, 오디오가 목소리나 리듬을 제어하는지 밝힙니다.
4–15초를 시작, 전개, 마지막 홀드로 나누고 관찰 가능한 행동을 지정합니다.
프레이밍, 렌즈 감각, 이동, 속도와 무엇을 보여주려는 움직임인지 설명합니다.
대사, 공간음, 효과음, 음악을 나누고 시작, 강도, 화면과의 관계를 지정합니다.
정체성, 제품 형상, 의상, 조명 방향, 텍스트와 마지막 프레임을 고정합니다.
모든 지시를 화면 또는 사운드에서 검수할 수 있어 수정 범위가 선명합니다.
배포 12초 16:9 프리미엄 제품 필름, 네이티브 스테레오 오디오. 레퍼런스 역할 @이미지1은 병의 형상과 라벨 안전 영역을 제어. @비디오1은 느린 손동작만 제어. @오디오1은 말투만 제어. 시간축 0–4초 — 85mm 매크로로 응결을 가로지름. 잔잔한 룸톤과 유리 디테일 사운드. 4–9초 — 카메라가 빠지며 손이 병을 30도 회전. 차분한 짧은 대사. 9–12초 — 고정 히어로 숏, 앰버 림라이트, 짧은 음악 마무리. 불변 요소 병 비율, 캡 높이, 라벨, 카메라 축과 빛 방향 유지. 자막과 추가 물체 금지.
안정적인 정체성, 실제 동작 레퍼런스, 들리는 퍼포먼스 또는 시작에서 끝까지 명확한 흐름이 필요한 짧은 영상에 적합합니다.
4–15초 안에 훅, 시연, 보이스 라인, 촉감 사운드와 마지막 제품 프레임을 구성합니다.
매크로, 손동작, 사용 장면과 깨끗한 마지막 홀드까지 형상과 재질을 유지합니다.
정체성, 시선, 반응, 대사, 입 모양, 공간음과 카메라 거리를 조율합니다.
9:16으로 구성하고 비디오 레퍼런스로 연기를 안내한 뒤 모바일에서 읽히는 화면으로 끝냅니다.
동작 악센트, 카메라 리듬, 분위기와 마지막 비트를 오디오 레퍼런스에 맞춥니다.
제품, 인물, 구조와 타이밍을 유지하면서 대화 언어를 전환합니다.
길이, 멀티모달 레퍼런스, 네이티브 스테레오 오디오, 화면비, 768P·2K 출력, 프롬프트와 Hailuo 2.3 차이를 확인하세요.
길이, 시작·종료 프레임, 레퍼런스 역할, 카메라, 대사, 공간음과 사운드를 설정하고 MiniMax H3 워크스페이스에서 생성하세요.
