47 modèles disponibles
Génération et édition d'images à l'état de l'art — de classe Gemini
Modèle de raisonnement Kling O1 avec une qualité cinématographique renforcée
GPT Image 1.5 génère des images haute fidélité en suivant le Prompt de près, tout en préservant composition, éclairage et détails fins
Génération et édition d'images de classe Gemini — le Nano Banana 2 en version complète.
Modèle d'image nouvelle génération — rendu du texte quasi parfait (>99%), photoréalisme accru, détail digne d'une UI ou d'une capture d'écran, et texte multilingue supérieur (JP/KR/HI/BN). Prend en charge une génération guidée par image de référence en option.
Édition précise d'une seule image avec préservation des détails. Bâti sur l'architecture nativement multimodale de GPT-Image 2.0.
Édition et transformation d'images avancées
Reve 2.1 : conçu pour le respect du Prompt et une typographie nette dans l'image. Rend jusqu'à quatre variations par requête, dans tous les cadrages du carré au panoramique, en conservant la mise en page et le placement du texte sur l'ensemble. Tarif premium, et le rendu de texte le plus net du catalogue.
Le modèle phare de NVIDIA pour le texte vers image photoréaliste, avec raffinement agentique optionnel : il génère plusieurs images candidates par tour et réécrit le Prompt entre les tours pour une meilleure fidélité au Prompt. Photoréalisme haut de gamme tenant compte de la physique, expansion de Prompt en JSON structuré prise en charge.
Modèle d'image premium pour un texte vers image précis et une édition multi-références — visuels produit, ressources de design, mises en page denses et créations commerciales. Le mode édition accepte jusqu'à 10 images de référence.
Agrandissement d'images de précision Gigapixel de Topaz Labs — agrandit les photos fidèlement jusqu'à 4x, avec des contours nets et un détail propre.
Agrandisseur d'images génératif Wonder 3.5 de Topaz Labs — récupère et reconstruit le détail des images de mauvaise qualité ou abîmées, tout en agrandissant jusqu'à 4x.
GPT-Image 2.5 Flare — le modèle d'image par défaut d'OpenAI, lancé avec ChatGPT Images 2.5. Génération rapide et de haute qualité : éclairage naturel, textures riches, mises en page complexes et fonds transparents (PNG/WebP).
GPT-Image 2.5 Flare pour la retouche d'images — décrivez la modification à appliquer à une image source, avec jusqu'à trois images de référence supplémentaires. Prend en charge la sortie transparente.
GPT-Image 2.5 Sunburst — le modèle d'image de précision d'OpenAI pour les visuels haut de gamme. Plus de fidélité sur les détails complexes, en échange d'un temps de génération plus long.
GPT-Image 2.5 Sunburst pour la retouche d'images — des modifications précises qui préservent les détails, à partir d'une instruction et d'une image source, plus jusqu'à trois références.
Le modèle Muse Image de Meta suit fidèlement les instructions et offre une fidélité visuelle exceptionnelle : les détails fins comme le texte, les graphiques et les codes QR sont rendus avec précision. Génère des images à partir de Prompts textuels dans neuf formats, à $0.01 fixe par image.
Le modèle Muse Image de Meta en mode édition : des retouches précises qui ne modifient que ce que vous demandez, restent cohérentes d'un tour à l'autre et combinent plusieurs images de référence. Accepte 1-10 images de référence, à $0.01 par image générée.
Modèle d'image Wan 2.7, palier de qualité supérieure — texte vers image et édition d'images unifiés.
Le V4 d'Ideogram — meilleur rendu du texte dans l'image de sa catégorie, typographie plus nette, suivi du Prompt renforcé et trois vitesses de rendu (TURBO / BALANCED / QUALITY). Prise en charge native de plusieurs formats, sans fine-tuning pour affiches, logos, miniatures et publicités.
Décompose une image en calques modifiables — arrière-plan, sujet et chaque élément visuel clé en PNG transparent distinct. Basé sur la compréhension d'image de Seedream 5.0 Pro : la structure et les détails survivent à la séparation. Le nombre de calques dépend de l'image.
Grok Imagine Image 2.0 de xAI — text-to-image rapide avec option 2K, réglage de qualité faible/moyenne et treize formats d'image, de l'ultra-large à l'ultra-vertical. Jusqu'à quatre images par requête.
Grok Imagine Image 2.0 de xAI à prix bas et forfaitaire — typographie nette et suivi précis du Prompt, en cinq formats d'image. Une image par requête, sans réglage de qualité ni de Résolution.
Grok Imagine Image 2.0 de xAI en mode édition — donnez-lui jusqu'à trois images : il les modifie, les compose ou les restyle en préservant identité et style. Mêmes paliers 1K/2K et qualité faible/moyenne que le générateur, jusqu'à quatre résultats par requête.
Le modèle d'essayage virtuel de Google. Combine la photo d'une personne et l'image d'un vêtement en un essayage réaliste.
Agrandisseur d'images créatif Bloom 2 de Topaz Labs — réinvente le détail pour un rendu saisissant. Idéal pour les images générées par IA qui méritent une finition premium.
Krea 2 Turbo — génération text-to-image optimisée pour la vitesse, avec toute la palette esthétique de Krea 2. Idéation rapide avec expansion du Prompt et modes d'accélération.
MAI-Image-2.5 de Microsoft : génération texte vers image polyvalente, avec un fort photoréalisme, un bon respect du Prompt et un rendu du texte dans l'image. Jusqu'à 4 images par requête et sept formats d'image.
Variante image de Grok Imagine. Text-to-image et édition par variation image-to-image, avec un suivi fidèle du Prompt. Modèle jumeau de Grok Imagine Video.
Agrandissement d'images SeedVR2 — rapide et peu coûteux, jusqu'à 4x. Excellent rapport qualité-prix au quotidien.
Modèle d'image Wan 2.7 — texte vers image et édition d'images unifiés.
Modèle d'image léger de 6B de Tongyi-MAI — rendu photoréaliste, génération en moins d'une seconde et rendu de texte bilingue (anglais + chinois) remarquablement précis. Sous licence Apache-2.0.
Modèle d'image Gemini rapide et économique : idéation rapide, génération à haut débit et retouches légères. Conçu pour l'exploration de concepts, les visuels sociaux, les maquettes produit et la production à grande échelle.
Traduisez le texte contenu dans une image vers une autre langue et récupérez une version propre et localisée — idéal pour localiser affiches, menus, captures d'écran et photos de produit.
Génération d'images standard de Nano Banana
Édition d'images avec Nano Banana
Édition image vers image avec FLUX 2 Pro
Génération rapide de texte vers image avec FLUX 2 Flex
Seedream 4.0 texte vers image
Seedream 4.5 texte vers image avec une qualité améliorée
Seedream 5.0 Lite, texte vers image rapide
Génération d'images multimodale par GPT-4o
Génération texte vers image avec Qwen
Qwen 2 : texte vers image amélioré
Agrandissement d'images par IA Topaz avec amélioration des détails
Suppression d'arrière-plan Recraft AI
Upscaling d'images net par Recraft AI
55 modèles disponibles
Sora 2 avec une qualité améliorée et des durées plus longues
Modèle de génération vidéo à la pointe, d'une qualité et d'une compréhension exceptionnelles
Modèle de génération vidéo premium avec audio natif
Le tout dernier modèle vidéo de ByteDance. Génère jusqu'à 30 secondes en un seul plan avec audio synchronisé — dialogue, musique et effets dans la même passe — à partir d'un Prompt, d'une image de départ ou de jusqu'à 50 références image, vidéo et audio.
Le palier premium du Wan 3.0 d'Alibaba — rendu plus rapide, mouvement cinématographique et meilleure continuité visuelle. Modes texte, image et référence, clips natifs de 30 secondes en une seule passe, avec audio.
MiniMax H3 post-entraîné, classé #1 en qualité globale, compréhension du Prompt et esthétique face aux principaux modèles vidéo. Clips de 5-15 secondes en 480p, 768p ou 1080p natifs à partir d'un Prompt, d'une image de départ, ou de jusqu'à 9 images de référence, 3 clips de mouvement et 3 clips audio. La référence vers vidéo est désormais disponible pour tous : jusqu'à 2x plus rapide, avec une préservation du sujet bien plus forte.
MiniMax H3 Max with a built-in camera rig. Your still frame stays frozen while the camera flies a path you choose — orbit around a subject, push in, crane overhead, or set up to 12 poses by hand. 5-15 second clips in native 480p, 768p or 1080p.
Dernier fleuron de Kling : mouvement au meilleur niveau et qualité cinématographique
Le tout dernier modèle vidéo d'Alibaba. Clips natifs de 30 secondes en une seule passe — sans raccord — avec audio et mouvement au réalisme abouti, à partir d'un Prompt, d'une image de départ ou de références image, vidéo et audio.
MiniMax H3 (Hailuo-03) avec prise en charge LoRA pour l'image-to-video. Animez des images avec des modèles LoRA personnalisés sur quatre paliers de Résolution (480p/720p/1080p/2K), de 4-15 secondes, avec audio stéréo natif. Qualité supérieure au H3 de base.
Le modèle vidéo multimodal nouvelle génération de MiniMax (Hailuo-03). Génère une vidéo jusqu'en 2K avec audio stéréo natif à partir d'un Prompt textuel ou d'une image de référence, avec un bon suivi des instructions, du mouvement et un texte lisible à l'écran.
Le modèle vidéo multi-entrées de Google. Créez des clips de 4-10 secondes avec audio natif à partir d'un Prompt, d'une image, de trois images de référence ou d'une vidéo existante — puis remodelez les scènes en langage courant. Ancré dans la connaissance du monde réel de Gemini pour une physique et des mouvements cohérents.
Le modèle vidéo Omni de Google v1.1 — désormais avec contrôle de la Résolution (360p/720p/1080p/4K) et édition vidéo. Créez ou transformez des clips de 3-10 secondes avec audio natif à partir d'un texte, d'une image, de références ou d'une vidéo existante. Évolution de la v1 avec une flexibilité totale de Résolution.
MiniMax H3 Max on a faster inference stack at half the price. The same post-trained model tuned for prompt adherence and aesthetics — 5-15 second clips from a prompt or a start frame, in native 480p, 768p or 1080p.
Dernier Kling, mouvement et qualité au meilleur niveau
Grok Imagine Video 1.5 — image-to-video avec audio synchronisé, suivi fidèle du Prompt et qualité visuelle constante. Actuellement classé #1 au classement des tests à l'aveugle Arena pour l'image-to-video, devant Seedance 2.
Version plus rapide et plus économique de Veo 3.1
FLUX 3 de Black Forest Labs — texte vers vidéo avec audio synchronisé généré par le modèle lui-même. Jusqu'à 20 secondes en 1080p, sans image de référence.
Kling 2.0 avec une qualité et un mouvement nettement améliorés
Wan 2.7 — texte vers vidéo et image vers vidéo (première image / première et dernière image / continuation).
Agrandisseur vidéo créatif Astra 2 de Topaz Labs — réinvente les fins détails et produit généralement une sortie 4K. Clips jusqu'à 5 minutes.
Conversion professionnelle SDR vers HDR par Hyperion 2.5 de Topaz Labs — redistribue luminance et couleur tout en préservant le détail des textes, des visages et du mouvement.
Génération de vidéo haute qualité
Le plus récent Runway Gen 4.5 : texte vers vidéo avec image de référence facultative, 5/10s.
Seedance 2.0 : texte vers vidéo et image vers vidéo.
Super-résolution vidéo jusqu'en 4K propulsée par FLUX 3 de Black Forest Labs, avec un mode Precise fidèle à la source et un mode Creative d'amélioration des détails. Clips jusqu'à 20 secondes.
Agrandisseur vidéo génératif professionnel Starlight de Topaz Labs (Starlight Precise 2.6) — reconstruit du détail absent de la source, jusqu'à 4K.
Génération vidéo cinématographique
Synchronisation labiale professionnelle
Transfert de mouvement à partir d'une image et d'une vidéo de référence. Choisissez quelle pose pilote le résultat via le sélecteur d'orientation du personnage.
Kling 3.0 optimisé pour la vitesse — génération plus rapide avec une haute qualité visuelle. Text-to-video (Prompts jusqu'à 2,500 caractères), image-to-video depuis la première image et storyboard multi-plans (jusqu'à 6 plans guidés par Prompt dans un clip). Le niveau Standard est en 720p, le Pro en 1080p.
Runway Gen-4 Turbo video generation from text or a reference image. 5 or 10 seconds; 1080p supports 5 seconds.
Dernier Kling 1.x, avec une qualité améliorée
Génération de vidéo haute qualité par Luma AI
Modèle de vidéo courte cinématographique amélioré — mouvement plus fluide, meilleur suivi des instructions, audio natif et lip-sync multilingue. Text-to-video, image-to-video depuis la première image, et vidéo à partir de références (jusqu'à 9 images de référence).
Génération vidéo de haute qualité avec un mouvement marqué
Synchronisation labiale de vidéo à vidéo — aligne les mouvements des lèvres d'une vidéo existante sur l'audio cible. Doublage multilingue pris en charge.
Suppression d'arrière-plan vidéo sous licence, de qualité entreprise, signée Bria, avec correction du débordement de fond vert. Supprimez proprement les arrière-plans de vos clips vidéo, avec correction des reflets verts pour un keying professionnel.
Modèle de vidéo courte cinématographique — mouvement supérieur, éclairage digne du cinéma, suivi fidèle du Prompt et narration multi-plans. Un seul endpoint text-to-video + image-to-video.
Agrandissez et affinez une vidéo vers une résolution supérieure. Choisissez un facteur d'échelle de 1x à 8x (2x par défaut).
Le dernier modèle de génération de vidéo de Pika
Génération rapide de vidéo à partir d'images
Supprimez l'arrière-plan d'une vidéo et obtenez un détourage net du sujet, prêt à être incrusté sur n'importe quelle scène. Conservation de l'audio et couleur de fond en option.
Modèle de lip sync en espace latent
Modèle vidéo rapide et économique — texte vers vidéo et image vers vidéo (première image, dernière image ou référence) avec audio synchronisé en option. Idéal pour les brouillons rapides et les clips sociaux en volume.
Traduisez des vidéos courtes — transcrit la parole et génère un audio doublé et des sous-titres dans votre langue cible. Jusqu'à 6 minutes par clip.
Générez une vidéo partageable pour un morceau, avec crédits d'artiste et de site en option.
Variante plus rapide et moins chère de Seedance 2.0 — texte vers vidéo et image vers vidéo.
Modèle de génération de vidéo de niveau Standard
Veo 3.1 Lite — génération vidéo économique avec les modes texte vers vidéo, image vers vidéo et référence vers vidéo
Génération de vidéo haute qualité avec MiniMax Hailuo 2.3 Pro
Génération de vidéo avec MiniMax Hailuo 2.3 Standard
Génération de vidéo avec MiniMax Hailuo 02 Pro
Wan 2.6 Flash, image vers vidéo rapide
Agrandissement vidéo par IA Topaz
13 modèles disponibles
Synthèse vocale multilingue de haute qualité
Modèle de synthèse vocale premium
Génération musicale par IA — créez chansons, instrumentaux et bandes sonores
Synthèse vocale rapide avec une bonne qualité
Modèle de synthèse vocale
Synthèse vocale de haute qualité
Google DeepMind's latest music generation model. Generate almost any type of music from text descriptions, with optional image inspiration.
Synthèse vocale Gemini 3.1 Flash. 30 préréglages de voix, plus de 80 langues, balises expressives en ligne ([sigh], [laughing]), instructions de style jusqu'à 4K caractères et prise en charge multi-locuteurs.
Séparez un morceau en stems voix et instrumental, ou en jusqu'à douze stems d'instruments individuels.
Prolongez un morceau existant à partir de n'importe quel point, en conservant son style.
Chantez sur un instrumental que vous importez.
Créez un accompagnement sous les voix que vous importez.
Régénère une plage temporelle d'une piste, sans toucher au reste.
3 modèles disponibles
Reconstruit un maillage 3D à partir de quatre vues au maximum du même objet. Restitue les faces qu'une seule photo ne peut pas voir. Exporte en GLB, FBX, OBJ, USDZ et STL.
Transforme une seule photo en maillage 3D texturé. Topologie et nombre de polygones contrôlables, cartes PBR et rigging automatique en option. Exporte en GLB, FBX, OBJ, USDZ et STL.
Générez un maillage 3D texturé à partir d'une description textuelle. Topologie et nombre de polygones contrôlables, cartes PBR et auto-rigging en option. Export GLB, FBX, OBJ, USDZ et STL.