IA & Robots

Nano Banana 2.1 affine les retouches d’images et réduit le coût de son API

Le nouveau modèle de Google peut préserver une scène pendant la modification d’une zone précise et exploiter jusqu’à 14 références.

Karen Garcia Par Karen Garcia
5 min de lecture
Nano Banana 2.1 affine les retouches d’images et réduit le coût de son API
Photo d’illustration. Travail de retouche et de traitement d’image sur un écran d’ordinateur dans un espace de travail.

Google a dévoilé Nano Banana 2.1 le 6 octobre 2026, avec une retouche par masque, une meilleure cohérence des sujets et des tarifs d’API réduits.

Cette mise à jour du générateur d’images concerne aussi bien les utilisateurs des services de Google que les développeurs qui intègrent le modèle à leurs propres applications. Elle met l’accent sur le travail itératif, lorsque plusieurs modifications doivent être appliquées sans transformer involontairement le sujet ou le reste de la composition.

La disponibilité exacte nécessite néanmoins une distinction entre l’annonce et l’accès effectif. The Currency Analytics indique que Nano Banana 2.1 est proposé dans l’application Gemini et dans le Mode IA de Google Search. La publication mentionne également plusieurs outils destinés aux développeurs.

De son côté, 01net confirme son intégration à Google AI Studio, mais rapporte un déploiement toujours en cours. Dans Gemini, l’interface permet de sélectionner le modèle 3.6 Flash, sans donner la certitude que chaque génération repose déjà sur Nano Banana 2.1. La disponibilité dans Google Search repose, elle aussi, sur l’information publiée par The Currency Analytics.

Une retouche locale qui préserve le reste de la scène

La principale nouveauté pratique est l’édition fondée sur des masques. Ce procédé consiste à désigner une partie de l’image avant de demander sa modification. L’utilisateur peut ainsi cibler un élément déterminé, par exemple un objet, un vêtement ou une portion d’arrière-plan, tandis que les autres zones doivent rester inchangées.

Ce fonctionnement répond à une difficulté courante de la génération d’images par intelligence artificielle. Une demande locale formulée uniquement en langage naturel peut provoquer des changements ailleurs dans la scène, notamment dans la composition, les couleurs ou l’apparence du sujet. Le masque délimite la zone d’intervention et apporte donc un contrôle plus direct. Les informations publiées décrivent cette fonction, mais ne fournissent pas de comparaison chiffrée permettant de mesurer sa précision par rapport à Nano Banana 2.

Google met également en avant un meilleur design visuel et une cohérence renforcée des sujets. Cette dernière propriété vise à conserver l’apparence reconnaissable d’un sujet au fil des générations et des retouches. Elle ne concerne pas seulement les personnages, puisque la formulation englobe également les autres éléments représentés.

Ce progrès annoncé peut être utile lors de la préparation de variantes d’une même illustration. Une équipe peut, par exemple, vouloir modifier successivement un décor et certains accessoires sans voir l’élément central changer à chaque étape. Aucun test indépendant fourni dans les informations disponibles ne permet toutefois d’établir l’ampleur réelle du gain.

Une personne observant des tirages photographiques de fleurs tenus en main au-dessus d’une table.
Photo d’illustration. Sélection et comparaison de tirages photographiques disposés sur une table. Source : Pexels. Photographe : George Milton. Licence Pexels.

Google affirme que Nano Banana 2.1 « surpasse nos modèles précédents à tous égards ». Cette appréciation reste celle de l’entreprise. 01net relève que Google n’a communiqué ni benchmark ni comparaison détaillée pour accompagner la présentation. Quatre images produites avec le modèle ont été montrées, ce qui ne suffit pas à vérifier une supériorité générale.

Trois définitions et jusqu’à 14 références

Nano Banana 2.1 offre plusieurs réglages qui déterminent la qualité de sortie et la quantité de contexte visuel transmise au modèle. Ses capacités annoncées comprennent :

  • une génération en 1K, adaptée aux usages qui privilégient la rapidité ou un coût unitaire limité ;
  • une sortie en 2K, qui constitue un niveau intermédiaire entre définition et poids du fichier ;
  • une production en 4K, destinée aux créations demandant davantage de détails ;
  • jusqu’à 14 images de référence réunies dans une seule requête.

Les références visuelles peuvent donner au modèle plusieurs repères au lieu de faire reposer toute la demande sur une description textuelle. Elles servent à préciser les éléments dont la génération doit tenir compte. La limite de 14 correspond au nombre maximal accepté dans une requête, et non au nombre d’images produites.

Ces paramètres n’ont pas tous le même effet. La définition choisie agit directement sur la sortie et sur son prix dans l’API. Le nombre de références concerne plutôt le contexte confié au modèle. L’intérêt concret dépend donc du flux de travail : une retouche ponctuelle n’exige pas nécessairement 14 fichiers, tandis qu’une composition nourrie de plusieurs éléments peut exploiter cette capacité.

Ce que les nouveaux prix changent pour les développeurs

The Currency Analytics publie deux tarifs unitaires pour l’API développeur de Google. Ils varient selon la définition de l’image générée :

Définition Prix annoncé par image Repère d’usage
1K 0,0336 dollar Prévisualisations et productions moins détaillées
4K 0,0756 dollar Sorties demandant une définition supérieure

Une image 4K coûte ainsi 0,042 dollar de plus qu’une image 1K, soit environ 2,25 fois son prix. Pour un développeur, l’écart devient particulièrement visible lorsque l’application produit de nombreuses variantes ou relance fréquemment une génération. Le choix de la définition constitue alors un paramètre de coût, et pas seulement de qualité visuelle.

Selon la même publication, ces montants représentent environ la moitié des prix de Nano Banana 2. Les traitements par lots bénéficient en outre d’une réduction supplémentaire de 50 %. Leur coût exact dépend de la définition et du volume traités. Les informations publiées ne précisent pas si cette réduction est permanente ou limitée dans le temps.

Le traitement par lots peut intéresser les services qui n’ont pas besoin d’un résultat immédiat et regroupent plusieurs requêtes. À l’inverse, une application interactive doit aussi prendre en compte ses exigences de délai. La baisse annoncée rend les volumes plus faciles à absorber financièrement, mais elle ne renseigne ni sur la vitesse de génération ni sur la stabilité des résultats.

Photo à la une. Source : Pexels. Photographe : Darlene Alderson. Licence Pexels.

Karen Garcia

Produits, usages et culture numérique

Karen Garcia

Karen Garcia a travaillé comme cheffe de produit chez un distributeur d'accessoires mobiles avant de se consacrer à l'écriture. Elle couvre pour TechGuru la mobilité, le matériel, les objets connectés et les réseaux sociaux : smartphones, montres, casques, accessoires et usages. Elle garde ses anciens téléphones dans une boîte, étiquetés par année.