En esta entrada veremos cómo configurar proveedores de IA para generar imágenes con OpenClaw, elegir un modelo principal y definir sus fallbacks. Con ejemplos, prompts y capturas reales, pasaremos de interpretar una foto a editar imágenes y crear composiciones desde cero, listas para preparar una publicación en redes.
Para ver qué tienes disponible, escribe en un chat compatible:
/tool image_generate action=listSi tu canal no acepta la llamada directa, pide: «Lista los proveedores y modelos disponibles para generar imágenes». Es una consulta al agente; no un comando para la terminal del servidor.

Cómo OpenClaw elige el modelo para generar imágenes
Para generar imágenes, OpenClaw elige el modelo en este orden:
- Si la petición indica un modelo concreto, utiliza solamente ese modelo.
- Si configuraste un modelo principal para imágenes, utiliza ese.
- Si el principal falla, prueba los fallbacks de imágenes en el orden configurado. Si solo hay fallbacks, empieza por esa lista.
- Si no configuraste ninguna de esas opciones, busca automáticamente entre los proveedores que ya están disponibles.
La selección automática puede aprovechar un proveedor ya autenticado, como Google. El modelo de conversación y sus respaldos se configuran por separado: la generación de imágenes utiliza agents.defaults.mediaModels.image.
Flujo del canal a la imagen terminada
Cuando le pido generar o editar una imagen, el agente interpreta la petición y llama a image_generate. El proveedor crea el archivo y OpenClaw devuelve la imagen al chat.

El agente también puede coordinar varias herramientas en una misma tarea. Por ejemplo, podría interpretar una foto, generar una variante, guardar el archivo y preparar su publicación. En el mini laboratorio exploraremos estas capacidades con una foto, capturas de la web y una imagen creada desde cero.
Comandos para consultar y configurar los modelos de imágenes
Para fijar el orden, define primary y fallbacks. Aquí uso Gemini como principal y muestro cómo guardar OpenAI como ejemplo de respaldo. Guardar un fallback no prueba que funcione: verifica su acceso y cuota antes de depender de él.
Ejecuta estos comandos en la terminal del servidor. El contenedor del ejemplo se llama openclaw; puedes comprobar el tuyo con docker compose ps.
docker exec -it openclaw openclaw config set agents.defaults.mediaModels.image.primary "google/gemini-3.1-flash-image"
docker exec -it openclaw openclaw config set agents.defaults.mediaModels.image.fallbacks '["openai/gpt-image-2"]'El segundo comando reemplaza la lista de respaldos. Para conservar varios, inclúyelos en el mismo arreglo, en el orden que quieras probarlos. Puedes revisar lo guardado con:
docker exec openclaw openclaw config get agents.defaults.mediaModels.imageLa consulta muestra primary (el principal) y fallbacks (los respaldos, en orden). Estos comandos funcionan en OpenClaw 2026.9.4 y fijan la selección; no conectan cuentas ni agregan credenciales. Referencia de configuración.

Si el proveedor todavía no está conectado
Si usas API keys con Docker Compose, decláralas en el .env y pásalas al servicio. No las pegues en el chat. Este ejemplo solo muestra los nombres de las variables:
GEMINI_API_KEY=tu_key_de_google
OPENAI_API_KEY=tu_key_de_openaiservices:
openclaw:
environment:
GEMINI_API_KEY: ${GEMINI_API_KEY}
OPENAI_API_KEY: ${OPENAI_API_KEY}Después aplica el cambio desde la carpeta de tu Compose:
docker compose up -ddocker compose restart no incorpora cambios en las variables del contenedor. Si ya tienes el proveedor autenticado, esta parte puede estar resuelta.
Generar ≠ leer una imagen
Generar o editar produce una imagen nueva con image_generate. Leer una foto significa describirla, reconocer objetos o extraer texto. Que un proveedor pueda hacer una tarea no garantiza que tengas configurada la otra.
Para fijar Gemini como modelo de lectura, consultar lo guardado y ver sus fallbacks, ejecuta:
docker compose exec openclaw openclaw models set-image google/gemini-3-flash-preview
docker compose exec openclaw openclaw config get agents.defaults.imageModel
docker compose exec openclaw openclaw models image-fallbacks listEstos comandos configuran la herramienta de lectura, no la generación. El análisis automático de los adjuntos tiene además su propia configuración: tools.media.image. En el primer ejemplo del laboratorio veremos la diferencia al describir una foto.
Mini laboratorio para generación y lectura de imágenes en OpenClaw
Una vez que hemos configurado nuestro proveedor principal para generar imágenes y sus fallbacks, ha llegado el momento de probar qué podemos hacer con esta capacidad del agente. Para los ejemplos utilizaré una fotografía que he tomado (para lectura de imágenes) y capturas del reciente rediseño de esta página (para edición de imágenes). También veremos cómo crear imágenes desde cero (text-to-image).
Tú puedes utilizar lo que se te ocurra para cada uno de estos casos. Es lo bonito de tener una herramienta más para crear contenido.
1. Interpretar una imagen: Image-to-Text (I2T)
Aquí podemos adjuntar una imagen y el agente nos dirá su contenido. Si deseamos saber algo en específico, también podemos escribirlo. Para este ejemplo, simplemente le mandé una foto:

2. Edición de imágenes: Image-to-Image (I2I)
Para este primer ejemplo, como mencioné antes, utilicé dos capturas de pantalla de este blog, aprovechando que recientemente se rediseñó, para comparar sus temas claro y oscuro.
Combina las dos capturas siguientes en una sola imagen horizontal 16:9 para presentar el rediseño de josetejero.com.
Crea una única vista continua de la página utilizando la captura con tema claro en el lado izquierdo y la captura con tema oscuro en el lado derecho. No dividas ambas versiones con una línea vertical recta. En su lugar, utiliza una separación diagonal dinámica con una forma gráfica atractiva que atraviese la composición de arriba hacia abajo.
La división debe sentirse intencional y formar parte del diseño, pero no debe ocultar información importante ni cortar textos de forma incómoda.
Es fundamental que ambas capturas estén perfectamente alineadas entre sí y representen exactamente la misma página en la misma posición de scroll. El encabezado, títulos, subtítulos, textos, botones, tarjetas y demás elementos deben coincidir vertical y horizontalmente a ambos lados de la división.
Especialmente, cualquier texto atravesado por la transición debe continuar exactamente en el mismo renglón: las letras de la mitad clara y las letras de la mitad oscura deben quedar a la misma altura, con la misma línea base, tamaño, posición y espaciado, dando la impresión de que se trata de un único texto que cambia de tema al cruzar la división.
Presenta toda la interfaz como una tarjeta o ventana flotante ligeramente separada del fondo, con una sombra suave y suficiente espacio exterior alrededor. Detrás de la interfaz crea un fondo abstracto y desenfocado inspirado únicamente en los colores presentes en ambas capturas, mezclando de forma sutil los tonos del tema claro y oscuro. Aplica el desenfoque exclusivamente al fondo exterior. Toda la interfaz de josetejero.com debe permanecer completamente nítida, legible y detallada.
No inventes, reescribas ni reemplaces textos. No agregues nuevos elementos de navegación, iconos, botones, secciones o contenido que no aparezca en las capturas originales.
Ahora, otro ejemplo de edición de imágenes. En este caso utilicé tres capturas para mostrar el nuevo diálogo de configuración del fondo y la textura del sitio:
Crea un collage vertical 4:5 para Instagram con estas tres capturas de mi web. Las dos primeras muestran variantes visuales; la tercera es el diálogo «Taller del Cuaderno» que permite personalizarlas.
Distribuye las dos vistas en tarjetas ligeramente desplazadas y coloca el diálogo como una tercera tarjeta protagonista. Puedes superponer los márgenes, pero no tapes las opciones del diálogo ni los detalles que permiten comparar las texturas.
Mantén la estética neobrutalista: bordes oscuros, sombras desplazadas, papel claro y acentos azules y amarillos tomados de las capturas. Deja aire entre las piezas y un margen exterior generoso. Usa un fondo suavemente desenfocado para dar profundidad, con las tres tarjetas nítidas. Conserva los textos y controles originales; no agregues títulos, logotipos ni opciones nuevas.
3. Crear desde cero: Text-to-Image (T2I)
Para probar texto a imagen sin referencias, mantengamos la misma idea visual con una escena imposible:
Genera una imagen editorial horizontal 16:9: un cuaderno de papel cuadriculado abierto sobre una mesa, del que emerge una pequeña ciudad construida con tarjetas de una página web. Las ventanas del navegador son edificios de papel plegado; un cursor gigante, como una grúa, coloca la última tarjeta.
La mitad de la ciudad está iluminada por el día y la otra por una noche azul, como si fueran el tema claro y oscuro de la misma web. Mezcla fotografía de maqueta y collage de papel, con bordes neobrutalistas, sombras marcadas y detalles azules y amarillos. Un solo punto de atención, sin texto legible ni marcas de agua.
Si tienes varios modelos de generación disponibles, repite el mismo prompt indicando un identificador de tu lista en cada prueba. Conserva el formato y compara composición, materiales y seguimiento de instrucciones. La selección explícita prueba solo ese modelo.
Los controles detrás del prompt
Si necesitas una llamada más precisa a image_generate, estos son los campos relevantes para las pruebas:
Para qué | Campo |
|---|---|
Una referencia o varias |
|
Proporción de la composición |
|
Dimensiones concretas |
|
Formato del archivo |
|
Elegir un modelo para esa llamada |
|
El soporte depende del proveedor y del modelo. Comprueba las opciones aplicadas en el resultado; la referencia de generación de imágenes detalla los parámetros y límites.
Si algo falla
- No aparece
image_generate: revisa la autenticación del proveedor y la versión de OpenClaw. Si modificaste el.env, aplica los cambios al contenedor. - El chat funciona, pero la imagen falla: comprueba acceso, cuota y facturación del modelo de imágenes.
- El fallback nunca entra: comprueba si la llamada lleva un
modelexplícito; esa selección no recorre la lista de respaldos. - La edición cambia demasiado: reduce el cambio solicitado y enumera lo que debe conservar. Para texto de interfaz exacto, revisa la imagen contra el original.
La captura de proveedores es una fotografía de mi instalación, no una garantía para todos los modelos. Por ejemplo, que un proveedor ofrezca transparencia no implica que todos sus modelos la admitan.
De la imagen terminada a la publicación
Con el collage revisado y guardado, ya tenemos una pieza para presentar el rediseño. Falta acompañarla con un texto y llevarla a la red social. Si tienes conectada una herramienta de publicación, puedes continuar la misma conversación:
Prepara una publicación de Instagram con el collage que hicimos para presentar el rediseño de mi web. Escribe un texto breve y cercano sobre el tema. Incluye josetejero.com.
Muéstrame la imagen, el texto y la cuenta de destino antes de publicar. Después de mi confirmación, usa la herramienta de publicación conectada y devuélveme el enlace del post.
Aquí se completa el recorrido: interpretar las capturas, generar una composición, editarla, guardar el archivo y preparar su salida. La conexión con las redes sociales es el siguiente paso, y ya la explico en Publicar en redes sociales desde OpenClaw.
Fuentes
Ejemplos realizados con OpenClaw 2026.9.4. Revisión editorial: 17 de septiembre de 2026.
Comentarios
Sé la primera persona en comentar.