Guida ai modelli Filtrix / 014Rilasciato a giugno 2026
Alibaba Cloud · Da immagine a video

Happy Horse1.1

Trasforma un singolo fotogramma in una ripresa audiovisiva completa, con movimento cinematografico, audio nativo, lip-sync multilingue e output fino a 1080p.

1080p

Risoluzione massima

3–15 s

Durata flessibile della clip

24 fps

Output video MP4

Audio

Generato nello stesso passaggio

Output di esempioImmagine + audio
Demo ufficiale del modello

Input

Primo fotogramma

Output

Video + audio

Intervallo

3–15 secondi

I2V dal primo fotogramma
720p / 1080p
3–15 secondi
Audio nativo
Lip-sync multilingue

L'aggiornamento 1.1

Progettato per mantenere coerente la ripresa.

Alibaba Cloud presenta la versione 1.1 come un aggiornamento orientato alla produzione per movimento, coerenza, aderenza alle istruzioni, texture e suono.

01

Espressione dinamica più forte

Happy Horse 1.1 è ottimizzato per azioni energiche e leggibili, dai gesti sottili ai movimenti rapidi di prodotti e personaggi.

02

Identità del personaggio più stabile

La maggiore coerenza aiuta il soggetto a conservare tratti del volto, abbigliamento e dettagli visivi durante l'evoluzione della ripresa.

03

Migliore direzione tramite prompt

Descrivi azione, camera, illuminazione, dialogo e suono in un unico briefing di produzione, con una maggiore aderenza alle istruzioni.

04

Texture visiva più ricca

La versione 1.1 migliora il dettaglio dei materiali, la texture della luce e la finitura generale per filmati pronti alla produzione.

05

Generazione audiovisiva nativa

Crea movimento e suono insieme, inclusi atmosfera, effetti, dialogo e lip-sync multilingue.

Il prompt come shot list

Dirigi ciò che si muove e ciò che il pubblico sente.

Tratta il prompt come un briefing di produzione compatto. Azioni concrete, un chiaro movimento di camera e indicazioni sonore esplicite offrono al modello più elementi delle sole parole d'atmosfera.

Direzione della ripresa / 00:00–00:101080p
01 / Soggetto

Un flacone di profumo in ceramica su un piedistallo bagnato di pietra nera

02 / Azione

Gocce d'acqua scivolano sul vetro mentre il tappo ruota lentamente

03 / Camera

Apertura macro, poi una fluida mezza orbita all'altezza del prodotto

04 / Luce

Una luce calda di contorno illumina il vetro; riflessi freddi si muovono sullo sfondo

05 / Suono

Pioggia leggera, risonanza del vetro, un preciso clic metallico; niente musica

Sii specifico sull'azione visibile e sul risultato sonoro.Prova il tuo prompt

Casi d'uso in produzione

Più del movimento fine a sé stesso.

Il rilascio si concentra sui workflow più frequenti, in cui identità, movimento, texture e suono devono restare coerenti nella stessa ripresa.

Narrativa

Brevi scene drammatiche

Anima un keyframe incentrato sul personaggio in un momento completo di 3–15 secondi con azione, camera, dialogo e atmosfera.

Commercio

Pubblicità di prodotto

Trasforma una foto prodotto pulita in una creatività ecommerce basata sul movimento, con dettaglio tattile e colonna sonora generata nello stesso passaggio.

Campagne

Marketing del brand

Sviluppa concept visivi per lanci e campagne social preservando composizione e identità dell'immagine sorgente.

Worldbuilding

Concept CG per videogiochi

Dai vita a personaggi, ambienti e keyframe cinematografici per pitch, mood film e previsualizzazione.

Workflow da immagine a video

Dal primo fotogramma alla ripresa finale.

L'endpoint fal mantiene i controlli essenziali: un'immagine, un prompt facoltativo, risoluzione, durata, seed e verifica di sicurezza.

Passaggio 01

Scegli un primo fotogramma efficace

Carica un'immagine JPEG, PNG, BMP o WebP larga e alta almeno 300 px. Il file può pesare fino a 20 MB.

Passaggio 02

Dirigi movimento e suono

Scrivi fino a 2.500 caratteri su soggetto, azione, camera, illuminazione, dialogo, atmosfera ed effetti sonori.

Passaggio 03

Imposta la ripresa finale

Scegli 720p o 1080p e una durata da 3 a 15 secondi, quindi genera e perfeziona il prompt se necessario.

Input

JPEG · PNG · BMP · WebP

Dimensione immagine

Minimo 300 px · massimo 20 MB

Proporzioni

Da 1:2.5 a 2.5:1

Sicurezza

Verifica di input + output

FAQ

Prima di girare.

Dati verificati con le note di rilascio Alibaba Cloud e lo schema attuale dell'API image-to-video.

01Cos'è Happy Horse 1.1?+

Happy Horse 1.1 è il modello image-to-video di Alibaba per creare clip cinematografiche da un primo fotogramma, con audio nativo, lip-sync multilingue e output fino a 1080p.

02Il modello genera audio?+

Sì. Può generare video e audio sincronizzato nello stesso passaggio, inclusi atmosfera, effetti, dialogo e lip-sync multilingue.

03Quali durate sono supportate?+

L'API accetta qualsiasi durata intera da 3 a 15 secondi.

04Quali risoluzioni sono disponibili?+

Puoi generare a 720p o 1080p. Il risultato è un video MP4 a 24 fotogrammi al secondo.

05Quali formati immagine posso caricare?+

L'API accetta JPEG, PNG, BMP e WebP. Le immagini devono essere di almeno 300 × 300 pixel, fino a 20 MB e con proporzioni tra 1:2.5 e 2.5:1.

06Come devo scrivere il prompt?+

Descrivi soggetto visibile, azione, movimento di camera, illuminazione, dialogo, atmosfera ed effetti. Il prompt può contenere fino a 2.500 caratteri.

Pronto per il prossimo fotogramma?

Dai voce a un'immagine statica.

Apri il workspace image-to-video di Filtrix e trasforma il tuo keyframe in un video curato e pronto da condividere.

Fonti tecniche: Note di rilascio Alibaba Cloud e schema dell'API image-to-video di fal.

Specifiche verificate a luglio 2026