Black Forest Labs ha annunciato l’arrivo in Early Access di FLUX 3, nuovo modello multimodale pensato per lavorare con immagini, video e audio dentro un’unica architettura. La novità più interessante è la capacità di generare in una sola volta video fino a 20 secondi con audio nativo incluso.
Il progetto amplia il percorso già avviato con le serie FLUX. 1 e FLUX. 2 e punta non solo alla generazione, ma anche alla comprensione multimodale. Per chi segue il settore AI, il dato da tenere d’occhio è l’approccio unificato: un solo modello che gestisce più tipi di input e più modalità di output.
FLUX 3 unisce immagini, video e audio in un solo modello
FLUX 3 è costruito su un’architettura unificata che apprende congiuntamente immagini, video e audio. Il modello estende il framework Self-Flow, descritto come un sistema di apprendimento con self-supervised flow matching, e viene addestrato in modo sincronizzato sui tre tipi di contenuto per coprire sia i compiti di generazione sia quelli di comprensione.
Rispetto alle precedenti generazioni FLUX. 1 e FLUX. 2, il salto è soprattutto nella versatilità operativa. Non si parla più soltanto di creare contenuti visivi, ma di gestire flussi multimodali più complessi, con un’impostazione che può risultare interessante per strumenti creativi, pipeline video e applicazioni AI più avanzate.
- Generazione video fino a 20 secondi in una singola esecuzione.
- Audio nativo incluso nei video generati.
- Supporto per testo in video, immagine in video e video in video.
- Possibilità di continuare clip partendo da video e audio in ingresso.
- Supporto per keyframe in video, dialoghi multilingua e concatenazione di più inquadrature.
I primi confronti mostrano buoni risultati nei video con audio a 720p
Black Forest Labs ha diffuso anche alcuni dati di valutazione umana su video da 10 secondi con audio a 720p. In questo confronto, FLUX 3 avrebbe ottenuto una percentuale di vittoria del 69% contro Grok Imagine Video e del 52% sia contro Seedance 2.0 sia contro Gemini Omni Flash.
Sono numeri che suggeriscono un posizionamento competitivo, soprattutto perché riguardano clip con sonoro, uno degli aspetti più complessi da gestire in modo coerente. Va però ricordato che si tratta di risultati comunicati dal produttore e legati a uno scenario di test specifico.
- Vittoria del 69% contro Grok Imagine Video.
- Vittoria del 52% contro Seedance 2.0.
- Vittoria del 52% contro Gemini Omni Flash.
FLUX 3 guarda anche a editing immagini e robotica
Oltre al video, FLUX 3 viene presentato come un modello capace di generare e modificare immagini con supporto a più stili, rapporti d’aspetto e risoluzioni. Questo amplia il valore della piattaforma, perché la rende utilizzabile anche in workflow dove servono asset statici e clip animate dentro lo stesso ambiente AI.
C’è poi un’apertura interessante sul fronte robotico: Black Forest Labs sta collaborando con Mimic Robotics per studiare l’uso di FLUX 3 come modello di previsione dei comportamenti di un robot. È un segnale chiaro del fatto che il modello non viene pensato solo per la creatività generativa, ma anche per scenari fisici e decisionali più complessi.
- Generazione e editing di immagini.
- Supporto a diversi stili visivi.
- Compatibilità con più rapporti d’aspetto e risoluzioni.
- Collaborazione con Mimic Robotics per applicazioni nella previsione del comportamento robotico.







