MiniMax のオープンなマルチモーダル動画モデル

無制限MiniMaxH3

テキスト、画像、参照音声で演出。ネイティブのステレオ音声付きで、2K・最大15秒まで生成できます。実在の人物の写真も歓迎です。

3,482,705+ happy users

15s
最大の長さ
2K
解像度
ステレオ
ネイティブ音声
対応
実在の人物
Easy-Peasy.AI では無制限

あなたの顔は入力であって、拒否の理由ではありません

自分のポートレート、クリエイターの写真、チームのヘッドショット、顧客の承認を得た素材をアニメーション化できます。入力に認識できる人物が写っているというだけで、Easy-Peasy.AI が通常の H3 ジョブをブロックすることはありません。

無制限は無審査という意味ではありません。同意、肖像権、当社の利用規約、MiniMax の安全フィルターは引き続き適用されます。

実在のポートレートもOK

使用許可のあるセルフィー、ヘッドショット、クリエイター写真、チーム写真をお使いください。

クリエイター画像もOK

承認済みのクリエイター画像や顧客画像を、最初のフレームやキャラクター参照として使えます。

わかりやすいワークフローはひとつだけ

探し回るような「顔セーフ」モードも、生成前に有効化する別設定もありません。

あなたの権利は変わらず重要です

所有しているか、使用を許諾された肖像・素材のみをアップロードしてください。

3つの作り方

1つのモデル、あらゆる出発点

アイデアから、1枚のフレームから、あるいはマルチモーダルな参照一式から始められます。H3 は3つのワークフローすべてで同じ汎用モデルを使います。

T2V

テキストから動画へ

シーン、アクション、カメラ、セリフ、音を記述してください。H3 はそのプロンプトを、ネイティブのステレオ音声まで内包した一貫性のあるクリップに仕上げます。

  • 768P または 2K で 4〜15 秒
  • 横・正方形・縦の6つのアスペクト比
  • ネイティブのセリフ、効果音、音楽、アンビエンス
I2V

画像から動画へ

静止画を最初のフレームとして動かすか、最初と最後のフレームを両方アップロードして、ショットの始まりと着地点を正確にコントロールできます。

  • 対応するどんな画像からでも、最初のフレームからアニメーション
  • トランジションを制御するための最終フレーム(任意)
  • 出力のフレーミングは自動的にソースに合わせられます
R2V

参照から動画へ

キャラクター・商品・スタイルの画像と参照音声を組み合わせ、各ファイルの役割を自然言語で説明します。H3 はその関係性を1回の生成で解決します。

  • 参照画像は最大9枚
  • 参照音声は最大3クリップ、合計15秒まで
  • アップロードしたすべての参照に自然言語で役割を指定
公式のビデオ作例

MiniMax H3 の実力を見る

以下のクリップはすべて MiniMax H3 の公式リリースからのものです。音声をオンにして再生し、ネイティブのステレオ出力をお聴きください。

MiniMax の公式ローンチ発表を見る ↗

全モダリティでの演出

動画からのカメラワーク、画像からのキャラクター、音声からの声——それらを1つのプロンプトで組み合わせ

ネイティブのステレオ音声

セリフ、効果音、アンビエンス、定位までを映像と一緒に生成

映画のオープニングタイトル

一貫したアートディレクションとタイポグラフィによる、完成度の高いシネマティックなタイトルシーケンス

プロダクト & ゲームUI

インターフェースの動き、ブランドのディテール、シーン転換を1テイク通してまとめ上げ

動くポスター

縦位置のグラフィックデザインを、制御されたモーション作品へ

広告 & Eコマース

商品の見せ方、読みやすいブランド表現、ネイティブサウンドを備えた縦型CM

マルチモーダルなコンテキスト

参照同士の関係を H3 に伝える

多くの動画ツールは、キャラクター・商品・スタイル・声を別々の作業として扱います。H3 はそれらをひとつのコンテキストとして受け取ります。関係性を自然言語で説明すれば、どう融合させるかはモデルが判断します。

ディレクション例

画像1の人物を一貫させ、画像2の商品を目立たせ、歌声は音声1に合わせる。

9

参照画像

キャラクター、商品、ロケーション、スタイル、構図

3

参照音声クリップ

声質、歌声、音楽、サウンドの方向性

自然言語のプロンプト1つが、すべての入力をつなぎます →
ネイティブ 2K

単なるアップスケールではなく、ディテールを再生成

H3 は 2K ティアにインコンテキスト再生成を用います。ベースモデルはディテールを組み立て直す際に、元のプロンプトと参照コンテキストを改めて参照します。従来のアップスケーラーなら推測するしかない小さな文字、商品の質感、ブランド要素に効きます。

  • 4〜15 秒のどの長さでも 2K
  • 低コストで試すための 768P ティア
  • 広告、フィード、ワイドスクリーン向けの6つの出力比率
ネイティブステレオ

サウンドトラックは生成の一部です

音声、効果音、音楽、アンビエンスは映像シーケンスと一緒にモデリングされます。そのおかげで H3 は、口の動き、衝撃音、環境音、カメラの動きに共通のタイムラインを持ち、本物の左右のステレオ空間を実現します。

  • セリフや歌をシーンの中で生成
  • アクションに合わせたフォーリーと環境音
  • 参照音声で声質や音楽を方向づけ可能
ワークフロー

使い方

01

H3 のモードを選ぶ

AI動画ジェネレーターを開き、演出したい内容に応じて MiniMax H3、MiniMax H3 Image、MiniMax H3 Reference のいずれかを選びます。

02

コンテキストを追加する

テキスト、最初のフレーム、最初と最後のフレーム、あるいは参照画像と音声の組み合わせから始められます。実在の人物が写ったごく普通の写真も使えます。

03

関係性を演出する

Tell H3 what to borrow from each input: a face from Image 1, a product from Image 2, or voice timbre from Audio 1. Natural language connects it all.

04

仕上げを決めてレンダリング

4〜15 秒の範囲で任意の秒数を選び、効率的な 768P か、ディテール重視の 2K でレンダリングします。ステレオ音声は自動的に含まれます。

プロンプトガイド

シーンだけでなく、コンテキストをプロンプトする

優れた H3 のプロンプトは、何を作るのかと、各ソースが担う役割の両方を説明します。この4つの習慣で、マルチモーダルな演出はぐっと予測しやすくなります。

参照ごとに役割をひとつ明確に与える

H3 はファイル同士の関係を理解しますが、その関係は明示する必要があります。ソースを名指しし、何を引き継ぐのかを正確に伝えてください。

プロンプト例

プレゼンターの顔と服装には画像1を使う。画像2の商品はどのショットでも変えない。話し声は音声1に合わせつつ、以下のセリフから新しい言葉を生成する。

音もショットの一部として演出する

音は後付けではありません。セリフ、フォーリー、音楽、アンビエンス、そしてそれらがステレオのどこに位置するかを、映像上のアクションと一緒に記述しましょう。

プロンプト例

彼女は小声で「やったね」と言う。カメラが回り込むあいだ、風は左から右へ流れる。低いエンジン音は中央に留まり、最後の2秒まで音楽は入らない。

最終フレームを到達点として使う

最終フレームは、到達点をもう一度説明するのではなく、2枚の画像のあいだの道のりをプロンプトで説明したときに最も効果を発揮します。

プロンプト例

最初のフレームの空っぽの机から始める。カメラが寄っていくにつれて部品が精密な機械的手順で組み上がり、提供された最終フレームの完成した腕時計で終わる。

見せたい文字は正確に書く

H3 は文字とブランド表現へのこだわりとともにリリースされました。必要な語句は引用符で囲み、どこに出るかを指定し、レイアウトの指示はシンプルに保ちましょう。

プロンプト例

すっきりした商品のエンドカード。見出しは大きな白のコンデンス体で「MOVE LIGHTER」と入り、シューズの上に中央揃えで配置。画像2のブランドマークは右下にそのまま残る。

仕様

MiniMax H3 の技術詳細

最大の長さ
15s
4〜15 の任意の整数秒
解像度
2K
768P / 2K の出力ティア
音声
ステレオ
すべてのクリップとネイティブに生成
アスペクト比
6
21:9 · 16:9 · 4:3 · 1:1 · 3:4 · 9:16
プロンプトの長さ
4,000
Easy-Peasy ジェネレーターでの文字数
参照画像
9
JPG、PNG、WEBP、HEIC、HEIF
参照音声
3
WAV または MP3、合計15秒
最初と最後のフレーム
対応
開始点と到達点を制御
実在の人物を含む入力
受け付け可
顔が写っているという理由だけでは拒否しません
768P の価格
3 cr/s
デフォルトの4秒で12クレジット
2K の価格
5 cr/s
4秒で20クレジット
世代の進化

MiniMax H3 と Hailuo 2.3 の比較

H3 は、テキストと画像で分かれた生成器を超え、より長いクリップ、ネイティブステレオ、参照によるコントロール、2K 出力を備えた1つのマルチモーダルシステムへと進みました。

項目MiniMax H3Hailuo 2.3
最大の長さ4〜15 秒6秒または10秒
最大解像度2K1080P
ネイティブ音声すべてのレンダーにステレオ音声無音の動画出力
入力コンテキストテキスト + 画像 + 参照音声テキストまたは最初のフレーム画像
参照によるコントロール被写体・動き・スタイル・声を1つのモデルでテキストと画像で別々のワークフロー
最初と最後のフレーム対応済み旧来の専用ワークフローに限定
出力のフレーミング6つのアスペクト比に加え、アダプティブな参照モード16:9 in the Easy-Peasy catalogue
商用にそのまま使えるユースケース

作れるもの

広告

商品のアクション、読みやすいメッセージ、セリフ、効果音、完成したサウンドトラックを備えた縦型・横型のCMをまるごと制作できます。

Eコマース

参照画像で商品をぶれさせずに保ちながら、カメラ・環境・音が静止したカタログ写真をローンチ用のアセットへと変えます。

ゲーム & プロダクトUI

参照で与えたビジュアル言語を保ったまま、インターフェース、タイトル画面、商品のインタラクションをアニメーションできます。

映画タイトル & プレビズ

本制作に入る前に、オープニングシーケンス、カメラの動線、シーン転換を一貫した1テイクでプロトタイプできます。

声で導かれるキャラクター

人物やキャラクターの画像と参照音声を組み合わせ、声質・歌唱・話し方・同期した演技をコントロールします。

動くポスター

キャンペーンのアートワークを、制御されたタイポグラフィ、奥行き、パーティクル、音楽、ステレオのサウンドデザインを備えた縦型のモーション作品に変えます。

お客様の声

Our Trustpilot score

人々が公共のプラットフォームで行ったコメントを読んでください。

Jeff Wilson

By far the best compilation AI utility

By far the best compilation AI utility out there. Period. We have tried multiple platforms that would work for us - a small business - and it was a bit overwhelming two years ago. Easy-Peasy has been a godsend. So many freaking tools and no fewer than 10 (of the 200) are ones we use at least on a weekly basis. Ironically, their human support is one of the most appreciated elements.

Vivian Daze avatar

Vivian Daze

Great services

Great services, and lovely and attentive customer service. Would reccommend

Cody Crabb

Great service, Best AI tool

Kia Tiow | COGUE avatar

Kia Tiow | COGUE

Easy-peasy is an easy to pick up and awesome AI software. I love it.

Easy-Peasy AI

Dezign121 avatar

Dezign121

Easy-Peasy.AI is very user friendly & a lot more to explore not only in the lesson, very helpful assistant in both work & personal

Blanca Marin avatar

Blanca Marin

Very Good AI…

I really liked the easy-peasy AI service. It's a great tool, but I also had to ask them for a refund because I chose the wrong plan, and they were very quick to respond to my request. They looked into my case and I got my money back without any problems. Of course, I will continue to use it for my projects.

Easy-Peasy AI

Muhammad Md Rahim avatar

Muhammad Md Rahim

Very awesome and practical AI tool that can help improve our productivity and the quality of our work!

Ken Poon avatar

Ken Poon

Very useful and true to “Easy Peasy” on using AI. One platform on all the tools required for business needs. Marianna sharing is super informative on how to use easy-peasy.ai

Dennis Cambronero avatar

Dennis Cambronero

I have been using the tool for +1 year…

I have been using the tool for +1 year and I have to say it is amazing. I use it to create images, bots and access every LLM in one single place. I highly recommend it.

Yeah Likes avatar

Yeah Likes

Practical and Powerful Software which is all In one and versatile. Just finished their workshop and got practical and valuable tips and tricks.

FAQ

よくある質問

MiniMax H3 について知っておきたいこと

MiniMax H3 とは?

MiniMax H3 は、MiniMax が 2026年7月31日 にリリースした汎用マルチモーダル生成モデルです。テキスト・画像・動画・音声をまとめて理解し、ネイティブのステレオ音声付きで最大15秒の 2K 動画を生成します。MiniMax は、広告、ブランディング、Eコマース、UI/UX、ゲームなど幅広い領域でのコントロール可能な商用コンテンツ向けに設計しています。

MiniMax H3 における「無制限」とは?

Easy-Peasy.AI は、認識できる実在の人物が写っているというだけの理由で、ごく普通の画像を拒否しないという意味です。自分のポートレート、クリエイターの写真、チームのヘッドショット、顧客の承認を得た素材をアニメーション化できます。特別なトグルも別のワークフローも必要ありません。

無制限とは、安全上のルールがないという意味ですか?

いいえ。無制限とは、実在の人物が写ったごく普通の入力について述べたものであり、禁止コンテンツを指すものではありません。アップロードする肖像については権利と同意が必要です。欺瞞的ななりすまし、違法なコンテンツ、実在の人物や未成年者を含む性的コンテンツ、その他当社の利用規約で禁じられている用途は引き続き禁止されています。MiniMax の安全フィルターも引き続き適用されます。

MiniMax H3 は音声も生成しますか?

はい。H3 のレンダーには必ず、映像と一緒に生成されたネイティブのステレオ音声が含まれます。動画が完成した後にサウンドトラックを別途付けるのではなく、音声・効果音・音楽・アンビエンスをモデルが同時に扱います。H3 に無音生成の切り替えはありませんが、後からエディターでミュートしたり差し替えたりできます。

MiniMax H3 の動画はどのくらいの長さにできますか?

4〜15 の範囲で任意の整数秒を選べます。768P と 2K のどちらのティアでも、この長さの範囲すべてに対応しています。より長い物語は、Easy-Peasy.AI の動画エディターで複数の H3 ショットをつないで作れます。

参照素材には何を使えますか?

Easy-Peasy.AI の H3 Reference は、参照画像を最大9枚、参照音声クリップを3本まで受け付けます。各音声クリップは 2〜15 秒で、合計は 15 秒を超えられません。参照音声は必ず1枚以上の参照画像と組み合わせる必要があります。

MiniMax H3 で最初と最後のフレームは使えますか?

Yes. Upload a first frame to animate a still, then optionally add a last frame to define the destination of the shot. First/last-frame mode and reference mode are separate: one generation cannot mix frame-control images with reference images or audio.

Easy-Peasy.AI での MiniMax H3 の料金は?

料金は生成された秒数に応じて決まります。768P ティアは1秒あたり3クレジット、2K ティアは1秒あたり5クレジットです。デフォルトの 768P・4秒のレンダーは12クレジットです。ネイティブのステレオ音声と参照音声に追加料金はかかりません。

MiniMax H3 の動画を商用利用できますか?

はい。Easy-Peasy.AI で生成した動画は、広告、SNS投稿、商品ページ、クライアントワーク、ゲームなどの商用プロジェクトに利用できます。ただし当社の利用規約と、アップロードした素材に対するお客様の権利の範囲内に限ります。

AIでより速く作成します。
リスクフリーでお試しください。

時間を無駄にせず、生成AIの力ですぐに高品質なコンテンツを作成し始めましょう。

App screenshot