2026. 10. 7. 10:11ㆍAI/AI 활용
MiniMax H3는 영상과 소리를 함께 만드는 AI 모델이에요.
이번 글에서는 어떤 기능이 있는지, 우분투와 NVIDIA GPU에서 어떻게 준비하는지,
ComfyUI로 첫 영상을 만들고 무엇을 확인해야 하는지 정리했어요.
“영상은 만들었는데, 효과음과 배경음악은 또 따로 붙여야 하나요?”
AI 영상 작업을 하다 보면 은근히 손이 가는 부분이죠.
MiniMax H3는 이런 영상과 오디오를 함께 생성하는 쪽에 초점을 맞춘 모델이에요.
다만 공식 2K 데모를 봤다고 내 그래픽카드에서도 똑같이 나온다고 생각하면 곤란해요.
공개된 모델의 범위, 필요한 메모리, 국내 사용 허가를 먼저 확인해야 하거든요.

MiniMax H3 공식 소개 이미지 · MiniMax 공식 발표
설치 전 꼭 확인해 주세요.
2026년 10월 1일 확인한 공개 가중치 라이선스는 대한민국·EU·영국·미국을 적용 제외 지역으로 명시하고 있어요. 국내에서 공개 가중치를 내려받아 실행하려면 별도 허가를 먼저 확인해야 해요. 아래 로컬 절차는 유효한 사용 권한을 확보한 환경을 전제로 한 안내이며, 직접 실행한 성능 후기와는 달라요. 라이선스 원문 · 허가 신청 안내
목차
1. MiniMax H3란? 영상과 소리를 한 번에
2. 로컬 H3-Base와 공식 2K 서비스의 차이
3. 국내 라이선스와 GPU 준비물
4. 우분투에 ComfyUI 설치하기
5. H3 모델 다운로드와 워크플로 불러오기
6. 첫 영상 테스트: 설정과 프롬프트
7. 결과 확인: 영상·소리·GPU 메모리
8. 자주 만나는 오류와 해결 순서
9. 장단점과 총평
1. MiniMax H3란? 영상과 소리를 한 번에
MiniMax H3는 텍스트, 이미지, 영상, 오디오를 참고해
영상과 네이티브 스테레오 오디오를 함께 생성하는 멀티모달 모델이에요.
코딩이나 문답 중심의 MiniMax M 시리즈와는 용도가 달라요.
쉽게 말하면 “비 오는 골목을 천천히 걷는 장면”만 주문하는 게 아니라,
빗소리와 발걸음, 카메라 움직임까지 한 장면의 조건으로 전달하는 거예요.
나중에 아무 효과음이나 붙이는 방식과는 출발점이 다르죠.
| 방식 | 입력 | 해볼 수 있는 작업 |
|---|---|---|
| T2V / t2va | 텍스트 | 장면과 소리를 글로 설명해 영상 만들기 |
| I2V / fl2va | 텍스트 + 첫 프레임·마지막 프레임(선택) | 제품 사진이나 장면 사이에 움직임 만들기 |
| R2V / ref2va | 텍스트 + 참조 이미지·영상·오디오 | 인물·스타일·동작·목소리의 참고 대상을 지정하기 |
이름에 있는 VA는 Video와 Audio를 함께 다룬다는 의미로 이해하면 쉬워요.
단, 참조를 넣었다고 얼굴·로고·목소리가 항상 정확하게 유지되는 건 아니에요.
상업용 결과물은 프레임과 소리를 끝까지 확인해야 해요.
MiniMax가 공개한 멀티모달 생성 데모. 이 글의 로컬 실행 결과가 아니에요. · 출처 · 영상 직접 열기
2. 로컬 H3-Base와 공식 2K 서비스의 차이
가장 헷갈리기 쉬운 부분이에요.
공식 소개에는 최대 15초·2K 출력이 등장하지만,
공개 가중치로 시작하는 로컬 H3-Base와 전체 서비스는 구성이 같지 않아요.

MiniMax H3 공식 구성도. 문맥 정리 → 기본 생성 → 2K 재생성의 흐름이에요. · 공식 GitHub
| 구성 | 역할 | 공개 범위에서 알아둘 점 |
|---|---|---|
| H3-Context-IR | 여러 입력과 의도를 생성용 표현으로 정리 | 공식 저장소는 이 워크플로를 공개 릴리스에 포함하지 않는다고 설명해요. |
| H3-Base | 영상·오디오 기본 생성 | 로컬 실행의 중심이에요. 기본 공개 모델은 768p 수준의 출력을 안내해요. |
| H3-Regenerate-2K | 기본 결과와 원래 문맥을 다시 참고해 2K 재생성 | 현재 공개 안내에서는 별도 API 경로를 제공해요. 일반 업스케일러와 같지 않아요. |
ComfyUI 문서가 안내하는 네이티브 캔버스는
짧은 변 768픽셀, 16:9 예시로 1344×768이에요.
영상은 24fps이고, 공개 모델의 길이는 약 15초 범위로 안내해요.
로컬에서 2K 크기로 확대 저장하는 것과
MiniMax의 공식 2K 재생성 흐름을 재현하는 것은 다른 일이에요.
처음부터 “내 PC에서 공식 데모와 동일한 2K”를 목표로 잡기보다,
짧은 영상에 화면과 소리가 정상 생성되는지부터 확인하는 편이 좋아요.
3. 국내 라이선스와 GPU 준비물
한국에서는 가중치가 공개됐다는 것만으로 충분하지 않아요
H3는 Community License가 붙은 공개 가중치 모델이에요.
누구나 어디서나 제약 없이 쓸 수 있는 MIT·Apache 라이선스 모델처럼 보면 안 돼요.
공개 라이선스의 적용 제외 지역에는 대한민국이 명시돼 있어요.
국내 로컬 배포·실행은 MiniMax 허가 신청과 허용 범위를 먼저 확인해 주세요.
GPU가 있거나 개인 테스트라는 이유만으로 예외라고 단정할 수는 없어요.
광고·판매용 영상이라면 지역 조건과 상업 이용 조건도 각각 확인해야 하고요.
Hailuo의 H3 체험 페이지 같은 호스팅 서비스는 공개 가중치와 다른 서비스 약관을 적용받아요.
가볍게 기능부터 보고 싶은 분은 서비스의 지역별 제공 여부·요금·출력물 권리를 먼저 확인해 보세요.
ComfyUI 안에서도 로컬 모델 노드와 유료 API를 호출하는 Partner Nodes는 별개예요.
VRAM만 보지 말고 시스템 RAM과 저장 공간도 확인하세요
| 항목 | 확인할 내용 |
|---|---|
| 운영체제 | 아래 준비 명령은 Ubuntu 24.04 LTS의 Python 3.12 환경을 기준으로 구성했어요. 다른 버전은 Python·드라이버 호환성을 확인해 주세요. |
| GPU·드라이버 | NVIDIA GPU와 호환 드라이버가 필요해요. nvidia-smi가 정상 작동하고, 설치할 PyTorch CUDA 빌드와 드라이버가 맞아야 해요. |
| VRAM | 공식적으로 통일된 최소 VRAM 수치는 발표되지 않았어요. 양자화·오프로딩·해상도·길이에 따라 달라져요. |
| 시스템 RAM | GPU에서 내려놓은 모델을 RAM에 올릴 수 있어요. 24GB VRAM이 있다고 RAM 부담이 사라지는 건 아니에요. |
| 저장 공간 | 선택한 템플릿에 따라 수십 GB의 모델이 필요해요. 작업 계획상 SSD 여유 100GB 이상을 확보하면 편하지만, 공식 최소 조건은 아니에요. |
커뮤니티의 RTX 3090 사례에는 24GB 카드와 약 31GB 시스템 RAM에서
832×480, 약 15초 영상·오디오 생성에 23분 17초가 걸렸다는 기록이 있어요.
특정 설정의 사용자 보고이지, 24GB 카드 전체의 성능 보장이나 공식 권장 사양은 아니에요.
처음부터 15초를 돌리면 문제가 생겼을 때 기다리는 시간만 길어질 수 있어요.
짧고 낮은 해상도로 정상 작동을 확인한 뒤 길이와 해상도를 하나씩 올려보세요.
4. 우분투에 ComfyUI 설치하기
이제부터는 H3 사용 권한을 확보한 환경을 전제로 설명할게요.
H3는 CLI로 실행하는 경로도 있어서 ComfyUI 자체가 모델의 필수 구성 요소는 아니에요.
이 글에서는 처음 연결과 결과를 눈으로 확인하기 쉬운 ComfyUI 경로를 사용해요.
먼저, 어떤 도구를 왜 쓰나요?
ComfyUI는 AI 작업을 블록처럼 연결하는 실행 도구예요.
모델 불러오기, 프롬프트 입력, 영상 생성, 저장을 담당하는 블록을 노드,
이 연결과 설정을 묶은 작업 순서를 워크플로라고 불러요.
ComfyUI만 설치한다고 H3 모델까지 들어오는 것은 아니에요.
Python은 ComfyUI가 실행되는 언어·실행 환경이고,
venv는 다른 AI 프로그램과 패키지가 섞이지 않게 만드는 전용 공간이에요.
pip는 그 공간에 PyTorch 같은 Python 패키지를 설치하는 도구예요.
PyTorch는 실제 AI 연산을 맡고, NVIDIA GPU에서는 CUDA 지원 빌드를 사용해요.
Git은 ComfyUI 소스를 내려받고 버전을 관리하는 도구예요.
FFmpeg는 영상·오디오 변환과 합치기, 결과 파일 확인에 쓰는 보조 도구예요.
모든 네이티브 노드가 시스템 FFmpeg를 직접 요구하는 것은 아니지만,
이 글의 ffprobe 결과 검사와 일부 영상 워크플로에서 필요해요.
ComfyUI-Manager와 커스텀 노드는 확장 기능이에요.
아래 기본 H3 네이티브 템플릿 테스트에 무조건 추가할 준비물은 아니에요.
① 설치보다 먼저: 버전과 기존 환경 확인
아래 신규 설치 예시는 Ubuntu 24.04 LTS의 Python 3.12를 기준으로 해요.
Python 3.12가 H3의 유일한 지원 버전이라는 뜻은 아니에요.
ComfyUI 공식 문서는 Python 3.13을 잘 지원하며,
일부 커스텀 노드의 의존성 문제가 있으면 3.12를 시도하도록 안내해요.
3.14에서도 본체는 작동하지만 일부 확장 호환성은 따로 확인해야 해요.
nvidia-smi
free -h
df -h .
python3 --version
command -v python3
git --version
ffmpeg -version
python3 -m pip --version
명령을 찾지 못했다면 해당 도구의 설치 여부와 PATH를 확인해 주세요.
특히 시스템 Python에 pip가 없다는 이유만으로 python3-pip부터 설치할 필요는 없어요.
아래에서는 가상환경을 만들 때 준비되는 pip를 사용해요.
nvidia-smi가 실패하면 모델 다운로드보다 GPU 드라이버 점검이 먼저예요.
버전은 네 층으로 구분하면 덜 헷갈려요.
① Python 3.12: 패키지를 실행하는 인터프리터 버전
② torch·torchvision·torchaudio: 서로 호환되는 조합으로 설치할 Python 패키지
③ cu130: PyTorch가 사용하는 CUDA 13.0 빌드 계열
④ NVIDIA 드라이버: 그 빌드와 GPU를 실제로 지원해야 하는 시스템 구성 요소
nvidia-smi의 CUDA Version은 드라이버가 지원하는 CUDA 범위이고,
현재 PyTorch의 CUDA 빌드 버전은 torch.version.cuda로 확인해요.
둘이 숫자까지 꼭 같아야 하는 것은 아니에요.
일반적인 사전 빌드 PyTorch 설치는 필요한 CUDA 런타임 의존성을 함께 받아요.
따라서 CUDA Toolkit이나 nvcc를 먼저 별도 설치할 필요는 보통 없어요.
CUDA 확장을 직접 컴파일하는 커스텀 노드는 예외라서 별도 요구사항을 확인해야 해요.
확인 시점의 ComfyUI README는 NVIDIA RTX 20 시리즈 이상에서 cu130 이상을 요구해요.
NVIDIA 호환성 표에서 CUDA 13.x의 드라이버 하한 계열은 580 이상이에요.
이 숫자만 맞췄다고 모든 GPU·기능이 보장되는 것은 아니므로 빌드별 상세 조건도 확인해 주세요.
오래된 드라이버를 유지하려고 임의로 cu12x로 바꾸면 현재 ComfyUI 요구사항과 어긋날 수 있어요.
② 기본 도구는 없는 것만 설치
아래는 Ubuntu 24.04 기본 Python을 사용하는 Bash 터미널용이에요.
다른 가상환경이나 Conda 환경은 먼저 빠져나오세요.
Git·FFmpeg는 명령 존재 여부를, Python 3.12와 venv는 해당 모듈을 확인해요.
빠진 항목이 있을 때만 apt update와 설치를 실행하며, 전체 업그레이드는 하지 않아요.
missing=()
command -v git >/dev/null 2>&1 || missing+=(git)
command -v ffmpeg >/dev/null 2>&1 || missing+=(ffmpeg)
command -v ffprobe >/dev/null 2>&1 || missing+=(ffmpeg)
if [ ! -x /usr/bin/python3.12 ]; then
missing+=(python3.12 python3.12-venv)
elif ! /usr/bin/python3.12 -c "import venv, ensurepip" >/dev/null 2>&1; then
missing+=(python3.12-venv)
fi
if [ "${#missing[@]}" -gt 0 ]; then
sudo apt update && sudo apt install -y "${missing[@]}"
else
echo "기본 도구가 있어 설치를 건너뜁니다."
fi
다른 Ubuntu 버전에서는 위 패키지를 그대로 설치하지 마세요.
이미 Python 3.13 등으로 정상 실행 중이라면 굳이 3.12로 바꿀 필요도 없어요.
시스템 /usr/bin/python3를 바꾸거나 sudo pip, --break-system-packages를 쓰지 마세요.
명령은 있는데 실행 오류가 나는 경우에는 재설치부터 하지 말고 해당 오류를 먼저 확인해요.
③ ComfyUI와 전용 가상환경: 신규와 기존을 구분
처음 설치하는 경우에는 기존 작업과 다른 새 폴더를 사용하세요.
아래 ComfyUI-H3 폴더가 이미 있다면 실행하지 말고 다른 폴더명을 고르세요.
한 줄이라도 실패하면 다음 단계로 넘어가지 마세요.
git clone https://github.com/comfyanonymous/ComfyUI.git ComfyUI-H3
cd ComfyUI-H3
/usr/bin/python3.12 -m venv .venv
source .venv/bin/activate
# pip가 없을 때만 이 가상환경에 준비
if ! python -c "import importlib.util, sys; sys.exit(0 if importlib.util.find_spec('pip') else 1)"; then
python -m ensurepip
fi
python -m pip --version
python -c "import sys; print(sys.executable); print(sys.version); print('venv:', sys.prefix != sys.base_prefix)"
venv: True와 ComfyUI-H3/.venv 안의 Python·pip 경로를 확인하세요.
pip가 이미 있으면 그대로 사용하고 일괄 업그레이드하지 않아요.
이후 설치 명령을 python -m pip로 통일하면 다른 Python의 pip를 부르는 실수를 줄일 수 있어요.
Python venv 문서처럼 새 가상환경에는 기본적으로 pip가 준비돼요.
이미 ComfyUI가 있다면 위 clone·venv 생성과 아래 신규 PyTorch 설치를 건너뛰세요.
평소 사용하던 환경을 활성화한 뒤 먼저 버전과 GPU 검사를 해요.
기존 환경 이름은 .venv가 아닐 수도 있어요. Conda와 venv를 겹쳐 활성화하지 마세요.
H3 템플릿을 지원하고 정상 작동한다면 그대로 사용하세요.
업데이트가 필요하면 워크플로·custom_nodes·설정과 패키지 목록을 백업하고,
가능하면 별도 폴더와 새 환경에서 먼저 테스트하는 편이 안전해요.
Python 주 버전을 바꿀 때도 기존 .venv를 덮어쓰지 말고 새로 만드세요.
④ PyTorch는 호환되는 묶음으로 설치
PyTorch는 있느냐뿐 아니라 버전 조합과 GPU 작동 여부가 중요해요.
torch만 최신으로 올리고 torchvision·torchaudio를 그대로 두면 충돌할 수 있어요.
ComfyUI의 일반 최소 torch 2.7 안내가 모든 H3 기능의 동작 보장은 아니에요.
사용할 ComfyUI 릴리스와 H3 템플릿의 요구사항을 함께 확인해 주세요.
신규 가상환경용 고정 버전 예시로는 공식 PyTorch 배포표에 있는
torch 2.11.0 + torchvision 0.26.0 + torchaudio 2.11.0 / cu130 조합을 사용할 수 있어요.
이것은 공식적으로 함께 배포되는 패키지 조합의 예시이지,
이 글에서 H3 성능을 실측했거나 최신 H3 기능 전체를 검증한 환경이라는 뜻은 아니에요.
선택한 ComfyUI가 더 새 버전을 요구한다면 공식 배포표의 대응 조합으로 함께 바꾸세요.
# 새 가상환경에만 실행. 기존 정상 환경에는 재설치하지 않아요.
python -m pip install torch==2.11.0 torchvision==0.26.0 torchaudio==2.11.0 --index-url https://download.pytorch.org/whl/cu130
다음은 현재 설치된 세 패키지 버전을 제약 파일로 남기는 단계예요.
새 환경에서는 위 설치 후, 기존 환경에서는 백업 후 필요할 때만 실행하세요.
requirements.txt 설치가 PyTorch 조합을 몰래 바꾸는 대신,
요구사항이 맞지 않으면 충돌을 보고하고 멈추게 해요.
python -m pip freeze > packages-before-h3.txt
python -c "from importlib.metadata import version; from pathlib import Path; Path('h3-torch-constraints.txt').write_text('\n'.join(n + '==' + version(n) for n in ('torch','torchvision','torchaudio')) + '\n')"
# 변경 예정 목록과 충돌을 먼저 확인
python -m pip install --dry-run -r requirements.txt -c h3-torch-constraints.txt
# 위 검사가 성공하고 변경 내용을 확인한 경우에만 실행
python -m pip install -r requirements.txt -c h3-torch-constraints.txt
python -m pip check
정상인 기존 환경에서 H3가 이미 실행된다면 requirements 재설치도 필요 없어요.
ResolutionImpossible이 나오면 제약 파일을 지우거나 --no-deps로 강행하지 마세요.
선택한 ComfyUI와 맞는 공식 PyTorch 조합을 새 환경에서 다시 구성하세요.
pip check는 선언된 패키지 의존성을 확인할 뿐, GPU 커널과 영상 생성까지 검증하지는 않아요.
⑤ 버전·GPU 연산을 검사한 뒤 실행
python -m pip show torch torchvision torchaudio
python -c "import torch, torchvision, torchaudio; print('torch:', torch.__version__); print('vision:', torchvision.__version__); print('audio:', torchaudio.__version__); print('CUDA build:', torch.version.cuda); print('GPU available:', torch.cuda.is_available()); print('GPU:', torch.cuda.get_device_name(0) if torch.cuda.is_available() else 'not detected')"
# GPU available: True인 경우에만 간단한 GPU 연산 검사
python -c "import torch; x=torch.ones((64,64), device='cuda'); print((x @ x).mean().item()); torch.cuda.synchronize()"
GPU available: True, 자신의 GPU 이름, 연산 결과 64.0을 확인하세요.
False, import 오류, no kernel image 같은 오류가 나오면 모델 다운로드를 멈추고
가상환경 경로 → 패키지 조합 → 드라이버·GPU 지원 순서로 점검해요.
이 작은 연산이 통과해도 H3의 VRAM·양자화 커널 요구까지 보장하지는 않아요.
최종 확인은 다음 절의 짧은 H3 생성 테스트로 해야 해요.
python main.py
브라우저에서 http://127.0.0.1:8188을 열어요.
첫 테스트에는 외부 공개 옵션을 붙일 필요가 없어요.
원격 서버는 포트를 인터넷에 바로 열기보다 SSH 터널과 접근 제어를 사용하세요.
다음 실행부터는 설치를 반복하지 말고 ComfyUI-H3 폴더에서
source .venv/bin/activate → python main.py 순서로 실행하면 돼요.
짧은 H3 생성까지 성공했다면 아래처럼 환경 기록을 남겨두세요.
커스텀 노드는 그 이후 하나씩 추가하고 설치할 때마다 pip check와 생성 테스트를 반복해요.
이 기록은 재구성에 도움이 되지만 드라이버·모델·커스텀 노드까지 자동 복원하는 백업은 아니에요.
python -m pip freeze > requirements-h3-working.txt
git rev-parse HEAD > comfyui-h3-commit.txt
python --version > python-h3-version.txt
nvidia-smi > nvidia-h3-info.txt
5. H3 모델 다운로드와 워크플로 불러오기
H3는 파일 하나만 넣고 끝나는 작은 모델이 아니에요.
영상 생성 모델, 텍스트 인코더, 영상 VAE, 오디오 VAE가 함께 필요해요.
처음에는 공식 템플릿이 요구하는 조합을 그대로 맞추는 편이 안전해요.

Template Library → Video → MiniMax H3 T2V를 찾아 불러오세요.
기본 T2V·I2V·R2V 템플릿은 ComfyUI 0.30.0 이상을 요구해요.
이후 추가된 기능은 더 높은 버전이 필요하니, 최신 템플릿과 본체를 함께 맞춰 주세요.
모델 다운로드 안내창에서 파일명과 저장 폴더를 확인해요.
템플릿이 바뀌면 요구 파일도 바뀔 수 있으므로,
아래 목록보다 현재 불러온 공식 템플릿의 파일명을 우선해 주세요.
ComfyUI/models/
├── diffusion_models/
│ └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
├── text_encoders/
│ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
├── vae/
│ ├── minimax_h3_video_vae_int8_convrot.safetensors
│ └── minimax_h3_audio_vae_fp32.safetensors
└── loras/
└── minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16.safetensors
공식 네이티브 워크플로 문서에서 T2V 항목의 모델 다운로드 링크를 확인할 수 있어요.
기본 모델 파일은 Comfy-Org/MiniMax-H3에 배포돼요.
LoRA 등 추가 파일은 해당 템플릿의 링크를 따라가 주세요. 저장소 전체를 통째로 받을 필요는 없어요.
위 목록은 기본 T2V 조합이에요.
Turbo LoRA는 가속 기능을 꺼도 템플릿의 모델 검사에서 요구할 수 있어요.
템플릿에 embedding 파일이 연결돼 있다면 그것도 안내된 embeddings 폴더에 넣어 주세요.
참조 기반 R2V는 ref2va 모델을 사용해요.
T2V·I2V용 fl2va 파일만 받고 R2V까지 된다고 생각하면 안 돼요.
INT8·NVFP4 같은 표기는 저장·연산 정밀도와 관련된 양자화 형식이며,
모델 용량을 줄인다고 모든 GPU에서 같은 속도와 메모리로 동작하는 것도 아니에요.
모델을 넣은 뒤에는 새로고침하거나 ComfyUI를 재시작하고,
각 로더에서 파일명이 제대로 선택됐는지 확인하세요.
처음에는 별도 커스텀 노드나 속도 최적화를 한꺼번에 추가하지 않는 편이 좋아요.
6. 첫 영상 테스트: 설정과 프롬프트
첫 번째는 짧은 T2V로 시작하세요
| 설정 | 첫 확인용 기준 |
|---|---|
| 워크플로 | MiniMax H3 T2V |
| 해상도 | 템플릿의 빠른 미리보기 크기부터. 현재 문서는 약 0.4MP 프리뷰를 사용해요. |
| 길이 | duration 약 5초부터. 실제 프레임 수에 맞춰 길이가 조정될 수 있어요. |
| Steps | 20 |
| Lightning / turbo_mode | 처음에는 끄기 |
| Sampler / Scheduler | res_multistep / simple, 템플릿 기본값 유지 |
| Seed | 비교 테스트에서는 같은 숫자로 고정 |
길이는 24fps에서 17k+5 프레임 단위로 맞춰져요.
5초를 입력했다고 파일이 정확히 5.000초가 아닐 수 있으니,
작은 길이 차이만으로 실패라고 판단하지는 마세요.
아래는 복사해 시험해 볼 수 있는 예제 프롬프트예요.
실제 생성 결과가 아니라, 화면과 소리를 함께 점검하기 위한 입력 예시예요.
A single continuous shot of a white ceramic cup on a wooden table beside a window on a rainy afternoon.
The camera slowly pushes in. Steam rises gently from the cup.
Audio: steady soft rain outside and quiet indoor ambience.
No dialogue, no music, no subtitles, no text on screen.
Keep the cup shape and the table stable throughout the shot.
뜻은 간단해요.
“비 오는 오후, 창가의 흰 컵을 천천히 가까이 촬영하고,
창밖 빗소리와 조용한 실내 소리를 함께 만들어 달라”는 요청이에요.
장면을 단순하게 잡아야 형태 유지와 소리 생성 여부를 구분해서 보기 쉬워요.
Run 또는 Queue로 한 번 실행한 뒤, 영상과 소리를 모두 재생해 보세요.
파일이 생겼다는 사실과 쓸 만한 영상이 나왔다는 판단은 다르니까요.
ComfyUI 공식 T2V 템플릿의 AI 생성 예시. 위 컵 프롬프트의 결과나 이 글의 실측 영상이 아니에요. · 출처 · 영상 직접 열기
두 번째는 내 사진 한 장으로 I2V
T2V가 정상 작동하면 MiniMax H3 I2V 템플릿을 열고
직접 촬영했거나 사용 허가를 받은 제품 사진을 넣어보세요.
첫 테스트에서는 여러 장면 전환보다 작은 카메라 이동 하나가 좋아요.
Use the input image as the first frame.
The camera slowly moves from left to right while the product stays still.
Preserve the product shape, colors, and visible details.
Audio: quiet room ambience, no speech, no music.
One continuous shot, no cuts, no added text.
제품 모양과 색이 유지되는지, 배경이 갑자기 바뀌지 않는지 살펴보세요.
특히 로고와 작은 글씨는 공식 데모가 좋아 보여도 직접 확대해서 확인해야 해요.
세 번째는 한 번에 하나씩 바꿔 비교하기
같은 프롬프트와 Seed로 기본 20단계와 Turbo 8단계를 비교해 볼 수 있어요.
T2V·I2V의 Lightning 기능을 켜면 해당 Turbo LoRA를 사용해요.
생성 시간만 보지 말고, 소리의 자연스러움과 컵·제품 형태가 흔들리는지도 함께 비교하세요.
정상 동작을 확인한 뒤 16:9 네이티브 크기로 올리려면
Resolution Selector의 Megapixels를 0.98, Multiple을 32로 설정하거나
1344×768을 직접 지정하는 경로를 사용하세요.
공식 문서는 1.0MP가 1376×768을 만들어 픽셀 면적 상한을 넘을 수 있다고 주의해요.
7. 결과 확인: 영상·소리·GPU 메모리
“에러 없이 끝났다”에서 한 단계 더 확인해 볼게요.
ComfyUI의 저장 노드가 안내하는 output 경로에서 MP4를 찾고,
아래 명령의 파일명을 자신의 출력 파일 경로로 바꿔 실행하세요.
ffprobe -v error \
-show_entries stream=codec_type,codec_name,width,height,r_frame_rate,channels,sample_rate:format=duration \
-of json "output/생성된파일.mp4"
video 스트림과 audio 스트림이 모두 있는지,
해상도·프레임레이트·길이가 설정과 크게 어긋나지 않는지 확인해요.
스테레오 출력이라면 보통 오디오의 channels가 2로 표시돼요.
단, 오디오 스트림이 있다고 소리가 자연스럽다는 뜻은 아니에요.
생성 중 별도 터미널에서 GPU 상태를 보면 메모리 사용 흐름을 확인하기 좋아요.
watch -n 1 nvidia-smi
1초 간격 표시는 순간적인 최대 사용량을 놓칠 수 있어요.
엄밀한 벤치마크가 아니라 작업 중 상태를 살피는 용도로 생각해 주세요.
첫 실행은 모델 로딩이 포함되므로 다음 실행보다 오래 걸릴 수도 있어요.
| 확인 항목 | 판단 기준 |
|---|---|
| 화면 | 첫·중간·마지막 프레임이 검거나 멈춰 있지 않은지 |
| 형태 유지 | 컵 손잡이, 제품 윤곽, 인물 얼굴이 갑자기 변하지 않는지 |
| 소리 | 무음·잡음·갑작스러운 끊김이 없는지, 요청하지 않은 음악·대사가 생겼는지 |
| 동기화 | 보이는 움직임과 소리가 어색하게 따로 놀지 않는지 |
| 재현 기록 | GPU·RAM, ComfyUI 버전, 모델 파일명, 프롬프트, Seed, 해상도, 길이, 단계, 생성 시간 기록 |
같은 Seed라도 GPU·라이브러리·최적화 설정이 달라지면 결과가 완전히 같지 않을 수 있어요.
비교할 때는 같은 환경에서 한 가지 조건만 바꾸는 편이 좋아요.
git rev-parse HEAD
python -m pip freeze > h3-environment.txt
위 명령은 ComfyUI 폴더와 활성화한 가상환경에서 실행해요.
워크플로 JSON과 모델 파일의 출처·리비전도 함께 남기면,
나중에 업데이트한 뒤 결과가 달라졌을 때 비교하기 편해요.
8. 자주 만나는 오류와 해결 순서
| 증상 | 먼저 확인할 것 |
|---|---|
| GPU available: False | 가상환경이 맞는지 → NVIDIA 드라이버 → CUDA 지원 PyTorch 설치 순서로 확인해요. |
| 모델 파일이 목록에 없음 | models 하위 폴더와 정확한 파일명, 다운로드 완료 여부를 확인하고 새로고침·재시작해요. |
| H3 노드가 없거나 빨갛게 표시됨 | ComfyUI·템플릿 버전과 시작 로그의 노드 import 오류를 확인해요. 네이티브 노드가 없다고 무작정 커스텀 노드를 설치하지 마세요. |
| CUDA out of memory | 다른 GPU 작업을 닫고 길이·해상도·참조 수부터 줄여요. 양자화 파일과 오프로딩 사용 여부도 확인해요. |
| 프로세스가 Killed로 종료됨 | VRAM뿐 아니라 시스템 RAM 부족 여부를 확인해요. free -h와 시스템 로그를 함께 봐야 해요. |
| MP4는 있지만 소리가 없음 | audio VAE 로딩, 오디오 연결, 영상 저장 노드의 오디오 입력과 ffprobe 결과를 확인해요. |
| 검은 영상·형태 붕괴·글씨 깨짐 | 기본 템플릿과 기본 attention으로 돌아가 비교해요. 파일 생성 성공만으로 정상이라고 판단하지 마세요. |
Sage Attention, 희소 attention, Turbo LoRA는 속도 개선을 위한 추가 선택지예요.
H3를 처음 쓰기 위한 필수 구성으로 전부 설치할 필요는 없어요.
특히 체크포인트 정밀도와 attention 조합에는 제약이 있으니
첫 성공 뒤 공식 문서의 호환 조건을 읽고 하나씩 적용하는 편을 추천해요.
9. 장단점과 총평
좋은 점은 영상과 소리를 한 흐름에서 다룬다는 거예요.
텍스트만으로 시작할 수도 있고, 사진이나 다른 참조를 활용하는 방향으로 넓힐 수도 있어요.
로컬 실행 권한과 장비를 갖췄다면 워크플로와 생성 조건을 직접 관리할 수 있다는 점도 매력적이고요.
아쉬운 점은 진입 장벽이 가볍지 않다는 거예요.
모델 파일이 크고, VRAM 외에 RAM·저장 공간·드라이버까지 챙겨야 해요.
공식 2K 서비스와 로컬 공개 모델의 차이도 있고,
한국에서는 기술적인 설치보다 라이선스 확인이 먼저예요.
자주 묻는 질문
“H3는 무료인가요?”
공개 가중치를 제공한다는 것과 무료·무제한 이용은 다른 말이에요.
지역·상업 이용 조건을 확인해야 하며, 장비·전기·저장 비용도 들어요.
호스팅 서비스와 API에는 별도 요금이 적용될 수 있어요.
“RTX 3090이나 4090 한 장이면 충분한가요?”
24GB 카드의 커뮤니티 실행 사례는 있지만, 모든 설정에서 된다는 의미는 아니에요.
양자화 파일, RAM, 해상도, 길이, 오프로딩까지 함께 봐야 해요.
“로컬 설치만 하면 영상이 외부로 전송되지 않나요?”
로컬 네이티브 워크플로의 추론과 API 노드 호출을 구분해야 해요.
Partner Nodes, 프롬프트 보정 API, 추가 커스텀 노드가 섞였다면
어떤 서비스로 데이터가 나가는지 별도로 확인해 주세요.
정리하면, MiniMax H3는 영상과 소리를 같이 만들고 싶은 분이 살펴볼 만한 모델이에요.
다만 “오픈 모델이니까 바로 내 PC에서 무료 2K”라는 식으로 접근하면 기대와 달라질 수 있어요.
사용 권한 확인 → GPU 인식 → 공식 T2V 템플릿 → 짧은 영상 생성 → 화면·소리 검증.
이 순서로 시작하면 설치와 결과물의 문제를 훨씬 구분하기 쉬워요.
공식 자료와 참고 링크
MiniMax H3 공식 소개·데모
MiniMax H3 공식 GitHub·공개 범위
MiniMax 로컬 배포 가이드
ComfyUI H3 개요·설정 안내
ComfyUI T2V·I2V·R2V 모델·워크플로
ComfyUI 설치 README
MiniMax H3 라이선스 원문
RTX 3090 실행 사례: 커뮤니티 보고
자료 확인: 2026년 10월 1일. 버전·모델 파일·라이선스·서비스 제공 범위는 바뀔 수 있어요.
설치·테스트 절차는 공식 문서와 공개 사례를 바탕으로 정리했으며, 이 글 자체의 GPU 실측 결과는 포함하지 않았어요.
'AI > AI 활용' 카테고리의 다른 글
| Jev AI 사용법과 활용사례 5가지: 클로드·ChatGPT 차이부터 자동화까지 (0) | 2026.10.08 |
|---|---|
| 클로드 코드, 왜 자꾸 다시 고칠까? ECC, Context7, Strix 실전 사용법 (0) | 2026.10.07 |
| Ruflo 사용법: 클로드 코드에 AI 팀을 붙이면? 비용·장단점 (0) | 2026.10.05 |
| 클로드 파이낸셜 서비스, 돈도 벌 수 있을까? 사용법·실제 사례 (0) | 2026.10.04 |
| Medeo VideoClaw 사용법: 뜨는 콘텐츠, 아직도 감으로 찾나요? (0) | 2026.10.01 |