Black Forest Labs dévoile FLUX 3 : le modèle multimodal qui fusionne vidéo, son natif et robotique
Une révolution multimodale : un seul modèle pour le son, l’image et la vidéo
Le domaine de la création de contenu par intelligence artificielle franchit une étape importante. La jeune entreprise allemande Black Forest Labs a officialisé le lancement de FLUX 3, son nouveau modèle fondation multimodal. Alors que les architectures précédentes devaient juxtaposer des modèles séparés pour l’image, le son et la vidéo, FLUX 3 repose sur une architecture unifiée basée sur le principe du Self-Flow.
D’après la publication de l’équipe de recherche de Black Forest Labs, chaque modalité (image, séquence vidéo, son) constitue une projection d’une même réalité physique. En entraînant le réseau de manière conjointe sur ces différents canaux, le modèle apprend les contraintes du monde réel : l’impact d’un objet doit générer un son précis à l’instant exact du contact, et les mouvements doivent respecter les lois de la physique.
Génération vidéo de 20 secondes avec audio natif synchronisé
Parmi les avancées les plus marquantes apportées par FLUX 3 figure la possibilité de générer des clips vidéo d’une durée allant jusqu’à 20 secondes en une seule passe d’inférence. L’élément différenciant réside dans la prise en charge native du son synchronisé :
- Inférence unifiée : L’image, la musique, les effets sonores ambiants et les dialogues sont produits au sein du même calcul, garantissant un calage temporel rigoureux.
- Modes de création étendus : Le système prend en charge la génération à partir de texte (text-to-video), d’images (image-to-video), ainsi que le chaînage de séquences créatives.
- Disponibilité et Open Weights : Actuellement en accès anticipé pour la génération vidéo et l’action, le modèle bénéficiera également d’une version à poids ouverts (FLUX 3 Dev) plus tard dans l’année.
De la création visuelle à l’IA physique et la robotique
En parallèle de l’annonce principale, une collaboration a été dévoilée avec la société mimic pour présenter FLUX-mimic. Ce projet montre comment les capacités d’un modèle vidéo-sonore peuvent s’étendre à l’IA physique (Physical AI) en prédisant des trajectoires d’action pour des robots industriels.
En comprenant la dynamique visuelle et acoustique de l’environnement, FLUX-mimic permet à des bras robotiques d’exécuter des tâches de manipulation complexes dans des usines, avec des expérimentations déjà menées chez des constructeurs comme Audi. Cette convergence entre modèles génératifs et automatisation industrielle illustre l’évolution rapide des modèles fondation vers le monde réel.
Un nouveau standard pour la génération de contenu ?
En permettant d’obtenir une vidéo cinématique complète avec sa bande-son parfaitement alignée dès le premier prompt, FLUX 3 bouscule les standards de la création numérique. L’approche holistique de Black Forest Labs pourrait bien redéfinir les workflows des créateurs de contenu et des cinéastes.
Pensez-vous que la génération simultanée du son et de la vidéo par une seule IA va remplacer les méthodes traditionnelles de montage et d’habillage sonore, ou restera-t-elle un simple outil d’assistance ? Partagez votre opinion dans les commentaires ci-dessous !
Photo : Google DeepMind sur Pexels.