FLUX 3 in Early Access

FLUX 3 debutta in Early Access: video AI fino a 20 secondi con audio

Black Forest Labs ha annunciato l’arrivo in Early Access di FLUX 3, nuovo modello multimodale pensato per lavorare con immagini, video e audio dentro un’unica architettura. La novità più interessante è la capacità di generare in una sola volta video fino a 20 secondi con audio nativo incluso.

Il progetto amplia il percorso già avviato con le serie FLUX. 1 e FLUX. 2 e punta non solo alla generazione, ma anche alla comprensione multimodale. Per chi segue il settore AI, il dato da tenere d’occhio è l’approccio unificato: un solo modello che gestisce più tipi di input e più modalità di output.

FLUX 3 unisce immagini, video e audio in un solo modello

FLUX 3 è costruito su un’architettura unificata che apprende congiuntamente immagini, video e audio. Il modello estende il framework Self-Flow, descritto come un sistema di apprendimento con self-supervised flow matching, e viene addestrato in modo sincronizzato sui tre tipi di contenuto per coprire sia i compiti di generazione sia quelli di comprensione.

Rispetto alle precedenti generazioni FLUX. 1 e FLUX. 2, il salto è soprattutto nella versatilità operativa. Non si parla più soltanto di creare contenuti visivi, ma di gestire flussi multimodali più complessi, con un’impostazione che può risultare interessante per strumenti creativi, pipeline video e applicazioni AI più avanzate.

  • Generazione video fino a 20 secondi in una singola esecuzione.
  • Audio nativo incluso nei video generati.
  • Supporto per testo in video, immagine in video e video in video.
  • Possibilità di continuare clip partendo da video e audio in ingresso.
  • Supporto per keyframe in video, dialoghi multilingua e concatenazione di più inquadrature.
Stato
Early Access
Architettura
Unificata per immagini, video e audio
Base tecnica
Estensione del framework Self-Flow
Il punto forte di FLUX 3 è l’integrazione reale tra modalità diverse, non solo la somma di funzioni separate.
La disponibilità iniziale è in accesso anticipato.
Funzioni principali dichiarate
Output video massimo
20 secondi per singola generazione
Audio
Integrato in modo nativo
Modalità supportate
Testo in video, immagine in video, video in video, continuazione da input video e audio
Controllo scena
Keyframe in video e concatenazione multi-shot
Lingue
Dialoghi multilingua

I primi confronti mostrano buoni risultati nei video con audio a 720p

Black Forest Labs ha diffuso anche alcuni dati di valutazione umana su video da 10 secondi con audio a 720p. In questo confronto, FLUX 3 avrebbe ottenuto una percentuale di vittoria del 69% contro Grok Imagine Video e del 52% sia contro Seedance 2.0 sia contro Gemini Omni Flash.

Sono numeri che suggeriscono un posizionamento competitivo, soprattutto perché riguardano clip con sonoro, uno degli aspetti più complessi da gestire in modo coerente. Va però ricordato che si tratta di risultati comunicati dal produttore e legati a uno scenario di test specifico.

  • Vittoria del 69% contro Grok Imagine Video.
  • Vittoria del 52% contro Seedance 2.0.
  • Vittoria del 52% contro Gemini Omni Flash.
Tipo di test
Valutazione umana
Formato analizzato
Video con audio
Durata del test
10 secondi
Il dato più forte comunicato finora è il confronto favorevole sui video sonori, segmento ancora molto competitivo.
I risultati disponibili riguardano un benchmark interno su una configurazione precisa.
Scenario di valutazione riportato
Risoluzione
720p
Audio
Presente
Metodo
Confronto con altri modelli tramite giudizio umano

FLUX 3 guarda anche a editing immagini e robotica

Oltre al video, FLUX 3 viene presentato come un modello capace di generare e modificare immagini con supporto a più stili, rapporti d’aspetto e risoluzioni. Questo amplia il valore della piattaforma, perché la rende utilizzabile anche in workflow dove servono asset statici e clip animate dentro lo stesso ambiente AI.

C’è poi un’apertura interessante sul fronte robotico: Black Forest Labs sta collaborando con Mimic Robotics per studiare l’uso di FLUX 3 come modello di previsione dei comportamenti di un robot. È un segnale chiaro del fatto che il modello non viene pensato solo per la creatività generativa, ma anche per scenari fisici e decisionali più complessi.

  • Generazione e editing di immagini.
  • Supporto a diversi stili visivi.
  • Compatibilità con più rapporti d’aspetto e risoluzioni.
  • Collaborazione con Mimic Robotics per applicazioni nella previsione del comportamento robotico.
L’estensione alla robotica è uno degli elementi più distintivi, perché porta il modello oltre il classico uso da generatore di contenuti.
Non sono stati comunicati prezzo o piani commerciali dettagliati al momento dell’annuncio.
Aree d’impiego evidenziate
Creatività visiva
Immagini e video
Contenuti audio-video
Video con audio nativo
Ricerca robotica
Uso come modello per behavior prediction

Altre notizie da leggere

Condividi con i tuoi amici

Lascia una risposta

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *

Questo sito utilizza Akismet per ridurre lo spam. Scopri come vengono elaborati i dati derivati dai commenti.

Verified by ExactMetrics