Glosario
In-image text
También conocido como: text rendering, in-frame text
Texto que aparece dentro de la imagen generada como parte de la escena: rótulos, texto de packaging, tarjetas de cita, etiquetas de infografía. Históricamente un punto débil de los modelos de difusión; en 2026, solo los modelos más potentes lo renderizan de forma legible.
En profundidad
Qué significa en la práctica
Durante la mayor parte de la era 2022-2024 de la generación de imágenes con IA, el texto dentro de la imagen era prácticamente galimatías: marcas con forma de texto que parecían letras de un alfabeto paralelo en lugar de palabras legibles. Nano Banana 2 (2025) y los últimos checkpoints de FLUX resolvieron esto para los alfabetos latinos; Nano Banana 2 lo extiende a alfabetos no latinos (chino, japonés, árabe, cirílico) con una fidelidad líder en su clase.
Para cualquier salida que necesite texto legible —tarjetas de cita, maquetas de packaging, rótulos en planos de establecimiento, etiquetas de datos en infografías, publicaciones sociales con texto superpuesto— Nano Banana 2 es la única opción viable en el segmento de consumo. Otros modelos producirán el aspecto visual pero perderán legibilidad en el texto.
Relacionado
Identity preservation
La capacidad de un modelo para mantener el rostro de una persona o la apariencia de un personaje coherente a lo largo de varias generaciones desde la misma referencia. Crítica para collages multipanel y contenido protagonizado por personajes.
Output resolution
Las dimensiones en píxeles de una imagen o vídeo generado. Valores comunes: 1024×1024 (por defecto en la mayoría de modelos de imagen), 4K (retrato de Nano Banana 2), 1080p (la mayoría de modelos de vídeo).
Prompt
La instrucción de texto que se da a un modelo de IA y que describe qué generar. Para los modelos de imagen y vídeo, los prompts combinan descripción del sujeto, dirección de estilo, indicaciones de cámara o composición y prompts negativos opcionales.