Filtrix モデルフィールドガイド / 0142026年6月リリース
Alibaba Cloud · 画像から動画

Happy Horse1.1

1枚の静止画から、シネマティックな動き、ネイティブ音声、多言語リップシンク、最大1080p出力を備えた完成映像を作成します。

1080p

最大解像度

3~15秒

柔軟なクリップ長

24 fps

MP4動画出力

音声

動画と同時に生成

出力サンプル映像 + 音声
公式モデルデモ

入力

最初のフレーム

出力

動画 + 音声

範囲

3~15秒

最初のフレームからI2V
720p / 1080p
3~15秒
ネイティブ音声
多言語リップシンク

1.1アップグレード

ショット全体の一貫性を保つ設計。

Alibaba Cloudはバージョン1.1を、動き、一貫性、指示追従、質感、音声を強化した制作向けアップデートとして位置づけています。

01

より力強い動きの表現

Happy Horse 1.1は、繊細なジェスチャーから商品や人物の素早い動きまで、エネルギーがあり分かりやすいアクションに最適化されています。

02

より安定した人物の同一性

一貫性の向上により、ショットが進んでも顔、衣装、特徴的なディテールを維持しやすくなります。

03

プロンプトによる演出を強化

動作、カメラ、照明、台詞、音を一つの制作ブリーフとして説明でき、指示をより正確に反映します。

04

豊かなビジュアルの質感

1.1では素材のディテール、照明の質感、全体の仕上がりが向上し、制作に使いやすい映像を生成します。

05

ネイティブな映像・音声生成

環境音、効果音、台詞、多言語リップシンクを含む動きと音を同時に作成します。

ショットリストとしてのプロンプト

何が動き、何が聞こえるかを演出。

プロンプトを簡潔な制作ブリーフとして扱いましょう。具体的な動作、明確なカメラワーク、音の指示は、雰囲気を表す言葉だけよりもモデルに多くの情報を与えます。

ショット演出 / 00:00–00:101080p
01 / 被写体

濡れた黒い石の台座に置かれた陶器の香水瓶

02 / 動作

キャップがゆっくり回る間、ガラスを水滴が滑り落ちる

03 / カメラ

マクロで始まり、商品と同じ高さから滑らかに半周する

04 / 照明

暖かなリムライトがガラスを捉え、背後で冷たい反射が動く

05 /

静かな雨、ガラスの響き、明確な金属音を一度。音楽なし

見える動作と聞こえる結果を具体的に記述してください。プロンプトを試す

制作での活用例

動かすだけではない価値。

このリリースは、人物の同一性、動き、質感、音を同じテイクで維持する必要がある、利用頻度の高い制作ワークフローに注力しています。

物語

短編ドラマと物語の一場面

人物中心のキーフレームを、アクション、カメラ、台詞、空気感を備えた3~15秒の完全なシーンにします。

コマース

商品広告

シンプルな商品写真から、触感のあるディテールと同時生成のサウンドトラックを備えた動きのあるECクリエイティブを作成します。

キャンペーン

ブランドマーケティング

元画像の構図とアイデンティティを保ちながら、ローンチやSNSキャンペーンのビジュアルコンセプトを展開します。

世界観構築

ゲームCGコンセプト

キャラクターアート、環境、シネマティックなキーフレームを、企画提案、ムード映像、プリビジュアライゼーション向けに動かします。

画像から動画のワークフロー

最初のフレームから最終テイクまで。

falエンドポイントの操作項目は、画像1枚、任意のプロンプト、解像度、長さ、シード、安全性チェックに絞られています。

ステップ 01

強い最初のフレームを選ぶ

縦横とも300px以上のJPEG、PNG、BMP、WebP画像をアップロードします。ファイルは最大20MBです。

ステップ 02

動きと音を演出する

被写体、動作、カメラ、照明、台詞、環境音、効果音を2,500文字以内で記述します。

ステップ 03

最終テイクを設定する

720pまたは1080p、3~15秒の任意の長さを選び、生成後に必要に応じてプロンプトを調整します。

入力

JPEG · PNG · BMP · WebP

画像サイズ

300px以上 · 最大20MB

アスペクト比

1:2.5~2.5:1

安全性

入力 + 出力チェック

よくある質問

生成を始める前に。

Alibaba Cloudのリリースノートと現在の画像から動画APIスキーマに基づいて確認しています。

01Happy Horse 1.1とは?+

Happy Horse 1.1はAlibabaの画像から動画モデルです。最初のフレームから、ネイティブ音声、多言語リップシンク、最大1080p出力を備えたシネマティックなクリップを作成します。

02音声も生成できますか?+

はい。環境音、効果音、台詞、多言語リップシンクを含む、同期した動画と音声を一度に生成できます。

03対応する動画の長さは?+

APIは3~15秒の範囲で整数の長さを指定できます。

04利用できる解像度は?+

720pまたは1080pで生成できます。出力は24fpsのMP4動画です。

05アップロードできる画像形式は?+

JPEG、PNG、BMP、WebPに対応します。画像は300 × 300ピクセル以上、20MB以下、アスペクト比1:2.5~2.5:1の範囲が必要です。

06プロンプトはどう書けばよいですか?+

見える被写体、動作、カメラワーク、照明、台詞、環境音、効果音を説明します。プロンプトは最大2,500文字です。

次のフレームを作りませんか?

静止画に声を与える。

Filtrixの画像から動画ワークスペースで、キーフレームを洗練された共有可能な動画に変換しましょう。

技術情報: Alibaba Cloud リリースノート および fal 画像から動画APIスキーマ.

仕様確認:2026年7月