옴니모달 비디오 생성 · 4~15초 · 768P 또는 2K
MiniMax H3 AI 영상 생성기네이티브 오디오로 시네마틱 영상을 만드세요
텍스트, 첫 프레임 또는 마지막 프레임, 이미지·비디오·오디오 레퍼런스로 시작하세요. 하나의 독립 웹 작업 공간에서 네이티브 32 kHz 스테레오 사운드가 포함된 24 FPS 영상을 연출할 수 있습니다.
독립 서비스입니다. MiniMax 또는 어떤 모델 소유자와도 제휴, 보증, 후원 관계가 없습니다.
MiniMax H3 가이드 / 2026년 8월 5일 확인
프롬프트부터 검토까지, 실전 H3 워크플로
MiniMax H3 AI는 텍스트, 이미지, 비디오, 오디오 맥락을 이해하는 옴니모달 비디오 생성 워크플로입니다. 자유로운 텍스트 프롬프트, 첫 프레임이나 마지막 프레임, 구조화된 시각·사운드 레퍼런스를 사용해 24 FPS, 768P 또는 2K, 네이티브 32 kHz 스테레오 오디오가 포함된 4~15초 클립을 만들 수 있습니다.
자유로운 구도를 위한 text-to-video
구도를 처음부터 새로 만들 수 있다면 텍스트로 시작하세요. 좋은 프롬프트는 촬영 지시처럼 피사체, 동작, 환경, 카메라 위치와 움직임, 조명, 속도, 가장 중요한 소리를 구체적으로 설명합니다. 장식적인 스타일보다 반드시 지켜야 할 연속성 조건을 먼저 적으세요. 여섯 가지 고정 화면비로 와이드, 가로, 정사각형, 세로 출력을 만들 수 있고 길이는 4초부터 15초까지 1초 단위로 선택할 수 있습니다.
이 방식은 콘셉트 탐색, 소셜 훅, 분위기 있는 인서트, 제품 장면, 시네마틱 B-roll에 적합합니다. 업로드한 자산 없이 모델이 문장을 이해했는지 확인할 수 있어 비교 테스트에도 좋습니다. 여러 후보를 만들고 정확한 설정을 기록한 뒤, 썸네일이 가장 멋진 결과가 아니라 실제로 사용할 수 있는 구간이 긴 결과를 선택하세요.
시작 또는 끝이 정해진 프레임 가이드 모션
Image-to-video에는 첫 프레임이나 마지막 프레임이 최소 한 장 필요하며 두 기준점 사이의 전환이 필요하면 둘 다 사용할 수 있습니다. 프레임이 구도를 정하므로 이 모드에서는 별도 화면비 값을 보내지 않습니다. 시간에 따라 변해야 할 카메라 이동, 몸의 움직임, 환경 반응, 타이밍과 그대로 유지해야 할 요소를 설명하세요. 화면에 이미 보이는 모든 세부를 반복하면 프롬프트 공간을 낭비하고 충돌을 만들 수 있습니다.
첫 프레임은 캠페인 키 아트, 제품 사진, 일러스트, 스토리보드 패널을 움직이는 데 유용합니다. 마지막 프레임은 공개 장면이나 변형의 도착 지점을 제어합니다. 프레임 모드와 멀티모달 레퍼런스 모드는 동시에 사용할 수 없으므로 파일을 올리기 전에 끝 구도와 폭넓은 정체성·모션 맥락 중 무엇이 더 중요한지 결정하세요.
연속성을 위한 멀티모달 레퍼런스
MiniMax H3 비디오 레퍼런스 워크플로는 이미지 최대 9개, 비디오 최대 3개, 오디오 최대 3개를 지원하며 전체 파일은 12개까지입니다. 각 비디오와 오디오 클립은 2~15초여야 하고 같은 미디어 유형의 총길이는 15초를 넘을 수 없습니다. 오디오만 단독으로 사용할 수 없으므로 시스템이 시각 맥락을 이해할 수 있도록 이미지나 비디오를 하나 이상 포함하세요.
각 파일에는 한 가지 역할을 부여하세요. 한 이미지는 인물 정체성, 다른 이미지는 의상, 또 다른 이미지는 장소를 정의할 수 있습니다. 짧은 비디오는 카메라 리듬이나 연기 동작을 보여주고 오디오는 타이밍, 공간감, 음색을 전달합니다. 파일이 많다고 항상 더 좋은 것은 아닙니다. 중복되거나 충돌하는 레퍼런스를 제거하고 프롬프트에서 어떤 속성을 어떤 소스에서 가져와야 하는지 명확히 적으세요.
2K 디테일과 네이티브 스테레오 오디오
빠른 탐색에는 768P를, 섬세한 질감, 머리카락, 소재, 환경 디테일 또는 큰 출력 프레임이 추가 크레딧을 정당화할 때는 2K를 선택하세요. 높은 해상도가 약한 구도나 불안정한 움직임을 고쳐 주지는 않으므로 먼저 경제적인 설정으로 장면 방향을 확인하세요. MiniMax H3 AI 비디오 비용에는 출력 길이, 레퍼런스 비디오 길이, 다섯 장을 초과한 이미지가 반영됩니다. 화면의 예상치는 참고용이며 서버가 업로드 메타데이터로 다시 계산합니다.
네이티브 스테레오 오디오는 별도 스톡 트랙을 붙이는 대신 영상과 함께 생성됩니다. 거리, 질감, 타이밍, 룸 톤, 동기화된 충격음, 짧은 대사처럼 물리적인 소리 지시를 작성하세요. 게시 전 발음, 립싱크, 클리핑, 원치 않는 음악, 채널 균형, 사용 권리를 반드시 확인해야 합니다. ‘네이티브’는 생성 방식을 뜻하며 완성된 믹스를 보장하지 않습니다.
이 AI 비디오 워크플로가 잘 맞는 작업
상업 콘셉트. 일반 촬영에 투자하기 전에 제품 공개 장면, 질감 테스트, 무드 필름, 세로형 캠페인 훅을 탐색하세요. 정확한 로고, 패키지 문구, 가격, 법적 고지는 편집 단계에서 확정적으로 추가하는 것이 안전합니다.
내러티브 프리비주얼. 스토리보드 프레임을 움직이는 초안으로 바꾸고 카메라 경로와 연기 에너지를 비교하세요. 레퍼런스로 장면 사이의 시각 언어를 이어가되 모든 결과는 편집 판단이 필요한 하나의 테이크로 다루세요.
크리에이터 제작. 음악 비주얼, 패션 루프, 설명 영상, 환경 숏, 소리가 포함된 짧은 소셜 스토리를 만드세요. 정체성을 중간에 잃는 과도한 장면보다 잘 제어된 15초 장면이 더 유용할 때가 많습니다.
모델을 선택하기 전에 워크플로를 비교하세요
모델 이름만으로는 제작 브리프에 답할 수 없습니다. 영어로 제공되는 실전 비교 자료 MiniMax H3 vs Seedance 2 및 MiniMax H3 vs Flux 3 Video에서 공개된 기능과 미공개 항목을 구분하고 모션, 레퍼런스, 오디오, 길이, 채택된 장면당 비용을 반복 가능한 방식으로 테스트하는 방법을 확인하세요.
장면에 꼭 필요한 정보부터 시작하세요.
자유로운 구도는 텍스트로, 시작이나 끝이 정해진 장면은 프레임으로, 인물·움직임·소리에 구체적인 기준이 필요하면 멀티모달 레퍼런스로 시작하세요.
연출하고, 기준을 주고, 전체 결과를 검토하세요.
피사체와 동작을 먼저 쓰고 환경, 카메라 경로, 조명, 속도, 연속성 조건과 중요한 소리 한두 가지를 추가하세요. 우선순위가 분명한 프롬프트가 형용사만 나열한 문장보다 효과적입니다.
한 가지 입력 방식을 선택하세요. 시작이나 끝 구도가 중요하면 프레임을, 정체성·움직임·리듬·분위기를 글보다 파일로 더 정확히 전달할 수 있다면 레퍼런스 모드를 사용하세요.
프롬프트 반영, 인체와 물체의 안정성, 카메라 연속성, 실제 사용 가능한 길이, 오디오 싱크를 확인하세요. 잘된 설정은 유지하고 다음 생성에서는 한 번에 한 변수만 바꾸세요.
명확한 연출을 시네마틱 H3 초안으로.
워크플로를 선택하고 4~15초, 768P 또는 2K를 설정한 뒤 결과를 생성해 내 작업물에서 확인하세요.
계획적인 반복 제작을 위한 크레딧.
출력 해상도, 길이, 레퍼런스 비디오 초수, 제작량에 맞는 플랜을 선택하세요.
Standard
Billed $238.80 yearly
- Commercial Usage RightsYearly Only
- Up to 624 videos
- Video models low to $0.11/s
- Up to 9,360 images
- All AI Models
- Priority Support
- Priority Processing Speed
- Remove Watermark
- Free Video UpscalerYearly Only
- Free Frame InterpolationYearly Only
- More Free AI ToolsYearly Only
Business
Billed $418.80 yearly
- Commercial Usage RightsYearly Only
- Up to 1,360 videos
- Video models low to $0.09/s
- Up to 20,400 images
- All AI Models
- Priority Support
- Dedicated Support
- Priority Processing Speed
- Remove Watermark
- Free Video UpscalerYearly Only
- Free Frame InterpolationYearly Only
- More Free AI ToolsYearly Only
Enterprise
Billed $898.80 yearly
- Commercial Usage RightsYearly Only
- Up to 3,920 videos
- Video models low to $0.06/s
- Up to 58,800 images
- All AI Models
- Priority Support
- Dedicated Support
- Priority Processing Speed
- Remove Watermark
- Free Video UpscalerYearly Only
- Free Frame InterpolationYearly Only
- More Free AI ToolsYearly Only
Included models
Credits activate instantly for MiniMax H3 generation workflows.

멋진 한 프레임이 아니라 전체 테이크를 평가하세요.
좋은 결과는 정체성, 움직임, 카메라 논리, 타이밍, 소리를 함께 유지합니다. 다음 장면에 설정을 이어가기 전에 전체 클립을 검토하세요.
생성기 열기MiniMax H3 AI FAQ
MiniMax H3 AI란 무엇인가요?
MiniMax H3는 텍스트, 이미지, 비디오, 오디오 맥락을 활용할 수 있는 옴니모달 비디오 생성 모델입니다. 이 독립 작업 공간에서는 text-to-video, 첫 프레임 또는 마지막 프레임 기반 image-to-video, 멀티모달 reference-to-video 방식으로 4~15초 영상을 만들 수 있습니다.
MiniMax H3로 오디오가 포함된 2K 영상을 만들 수 있나요?
현재 H3 워크플로는 768P 또는 2K 출력, 24 FPS, 네이티브 32 kHz 스테레오 오디오를 지원합니다. 네이티브 오디오는 영상과 소리가 함께 생성된다는 뜻이며 대사, 음악, 발음, 싱크가 항상 완벽하다는 보장은 아닙니다. 게시 전 전체 결과를 확인하세요.
어떤 레퍼런스 파일을 업로드할 수 있나요?
레퍼런스 모드는 이미지 최대 9개, 비디오 최대 3개, 오디오 최대 3개를 지원하며 전체 파일은 12개를 넘을 수 없습니다. 비디오와 오디오는 각각 2~15초여야 하고 같은 미디어 유형의 총길이는 15초 이하여야 합니다. 오디오만 단독으로 사용할 수 없으므로 이미지나 비디오를 함께 추가하세요.
첫 프레임과 마지막 프레임은 어떻게 사용하나요?
프레임 워크플로에서 첫 프레임, 마지막 프레임 또는 둘 다 업로드하세요. H3는 해당 프레임의 구도를 기준으로 움직임을 만들기 때문에 image-to-video 요청에는 별도 화면비 값을 보내지 않습니다. 한 요청에서 프레임 가이드와 멀티모달 레퍼런스 모드는 함께 사용할 수 없습니다.
MiniMax 공식 웹사이트인가요?
아닙니다. 이 사이트는 독립 AI 생성 서비스이며 MiniMax, ByteDance, Black Forest Labs, Flux 또는 어떤 모델 소유자와도 제휴, 보증, 후원 관계가 없습니다. 계정, 크레딧, 결제, 파일, 고객지원은 본 서비스에서 제공합니다.