Cómo diagnosticar y resolver errores 404 en Cloud Run

Problema En entornos de Cloud Run es frecuente que un servicio despliegue sin errores aparentes y, sin embargo, cualquier petición HTTP termine en la página genérica “404. That’s an error”. El contenedor está activo, la sonda de arranque pasa y los logs de Cloud Run no registran ninguna solicitud entrante. El síntoma se repite tanto con la URL canónica (*.run.app) como con la URL numérica, y ocurre tanto desde navegadores externos como desde Cloud Shell. En estos casos el problema no está en la aplicación (por ejemplo, Flask/Gunicorn) sino en la capa de control que dirige el tráfico hacia el contenedor. ...

August 23, 2026 · Ernesto

Cómo gestionar identidad, versionado y observabilidad de AI agents en AWS y otras nubes

Problema Los equipos que despliegan decenas o cientos de agentes de IA se encuentran con una brecha entre los bloques básicos de infraestructura (EC2, S3, VPC) y las necesidades operativas de los agentes: cada agente necesita una identidad única, un esquema de versionado, control de acceso a herramientas externas, métricas de rendimiento y una forma segura de actualizarse sin interrumpir el servicio. Cuando se usan solo recursos genéricos de la nube, el código de orquestación crece rápidamente y se vuelve difícil de mantener, especialmente cuando se añaden nuevas versiones o se cambian permisos de herramientas. El problema no es exclusivo de AWS; cualquier proveedor de nube deja al ingeniero la tarea de construir una capa de “agent‑platform” encima de los recursos básicos. ...

August 23, 2026 · Ernesto

Cómo proteger secretos con el secret‑safety skill en AWS Agent Toolkit

Problema Los agentes generados por LLM que interactúan con AWS suelen necesitar leer valores almacenados en AWS Secrets Manager. En entornos donde la confidencialidad es crítica, exponer el texto plano del secreto al modelo representa un riesgo: cualquier salida del agente podría filtrarlo accidentalmente o, peor aún, un atacante podría inducir al modelo a revelar la información. El patrón problemático es que, por defecto, el agente ejecuta la llamada GetSecretValue, captura el valor y lo inserta en su contexto antes de usarlo. Cuando el agente genera código o comandos que incluyen la variable, el secreto viaja dentro del prompt y queda registrado en logs de depuración, auditorías de modelo o incluso en la salida del propio agente. ...

August 22, 2026 · Ernesto

Cómo diseñar una Observability Platform reusable con Terraform

Problema En entornos híbridos (AWS, Azure y on‑prem) la observabilidad tiende a crecer de forma descoordinada. Cada equipo despliega su propio agente, define sus propias etiquetas y crea monitores aislados. Con el tiempo aparecen versiones de agentes desalineadas, configuraciones de logs duplicadas y una gran cantidad de dashboards que no siguen un estándar. El resultado es una base de código de observabilidad que se vuelve difícil de mantener, actualizar y auditar. Cuando se necesita añadir una nueva regla de alerta o actualizar la versión del SDK de APM, la intervención de varios equipos retrasa la entrega y genera errores de configuración. ...

August 20, 2026 · Ernesto

Cómo entender la jerarquía de Azure: Tenant, Management Groups, Subscription y Resource Group

Problema Muchos profesionales que migran de AWS a Azure se topan con una sorpresa: no basta con traducir nombres de servicios (EC2 → VM, S3 → Blob). El verdadero reto está en la forma en que Azure estructura la administración y la gobernanza. En AWS, la cuenta es el límite principal: facturación, cuotas, permisos y aislamiento se definen allí. En Azure, esa frontera se fragmenta en varios niveles (Tenant, Management Groups, Subscription, Resource Group) y cada uno puede recibir políticas o RBAC que se heredan hacia abajo. Cuando el equipo sigue pensando en “cuenta” como única zona de control, aparecen problemas de sobre‑permisos, facturación inesperada y dificultades para aplicar normas de compliance. ...

August 17, 2026 · Ernesto

Cómo automatizar auditorías de red con herramientas CLI estructuradas

Problema Los equipos de infraestructura suelen necesitar una visión periódica del estado de sus dispositivos de red: interfaces operativas, protocolos de enrutamiento, sincronización de tiempo, etc. Las herramientas tradicionales (ping, nmap, scripts ad‑hoc) devuelven texto libre, lo que obliga a parsear salida con expresiones regulares frágiles. Además, la falta de un formato estructurado complica la integración con pipelines CI/CD, sistemas de monitorización y procesos de gestión de cambios. Cuando varios dispositivos de diferentes vendors están involucrados, la heterogeneidad de comandos y la ausencia de un mecanismo de “snapshot → diff” hacen que la detección de desviaciones sea manual y propensa a errores. ...

August 15, 2026 · Ernesto

Cómo diagnosticar y solucionar errores ERR_SSL_VERSION_OR_CIPHER_MISMATCH al acceder a api.nuget.org en Windows

Problema En entornos Windows es frecuente encontrarse con la pantalla del navegador que muestra ERR_SSL_VERSION_OR_CIPHER_MISMATCH al intentar abrir una URL HTTPS que debería devolver JSON, como https://api.nuget.org/v3/index.json. El error no es un simple 404; indica que el cliente y el servidor no lograron negociar un algoritmo de cifrado compatible. El síntoma típico incluye: Navegador o herramienta curl devuelve el mensaje de error mencionado. PowerShell muestra fallos de Schannel en el Visor de eventos. Varios procesos (OneDrive, Visual Studio, etc.) registran “A fatal error occurred while creating a TLS client credential”. Aunque el caso concreto es NuGet, el patrón se repite con cualquier servicio que requiera TLS 1.2/1.3 y que dependa de la pila de seguridad de Windows (Schannel). El objetivo de este post es ofrecer una guía reutilizable para diagnosticar y corregir este tipo de fallos en cualquier máquina Windows. ...

August 15, 2026 · Ernesto

Cómo montar un pipeline CI/CD completo con Argo CD, Argo Workflows y Argo Image Updater en Kubernetes

Problema Muchas instalaciones de Kubernetes usan GitHub Actions, GitLab CI o Jenkins para compilar imágenes y aplicar manifiestos. Cuando el número de microservicios crece, la coordinación entre compilación, publicación de imágenes y despliegue se vuelve frágil: los pipelines están dispersos, los permisos son inconsistentes y la trazabilidad entre código y versión de imagen se pierde. El patrón problemático es intentar orquestar tres fases distintas (build, push, deploy) con herramientas que no comparten un modelo de estado único, lo que genera “drift” y fallos inesperados en entornos homelab o producción. ...

August 14, 2026 · Ernesto

Cómo manejar suspensiones de AWS por supuesta non‑payment en entornos de producción

Problema En entornos productivos basados en AWS es frecuente que una cuenta sea marcada como “suspended” bajo la razón non‑payment aunque el balance aparezca en cero. La suspensión bloquea el acceso a todos los recursos: clústers de EKS, bases de datos RDS, volúmenes EBS, colas de SQS, etc. El resultado inmediato es la caída total del servicio y la imposibilidad de usar credenciales IAM para exportar datos o ejecutar comandos. El problema se vuelve crítico cuando la suspensión ocurre justo antes de un lanzamiento o durante la facturación mensual, generando presión sobre equipos de negocio y clientes. ...

August 13, 2026 · Ernesto

Cómo simplificar despliegues multi‑service en Kubernetes con una plataforma auto‑hosted

Problema En entornos donde ya se ejecuta Kubernetes, los equipos de desarrollo a menudo se topan con una fricción constante: cada nueva aplicación requiere escribir varios archivos YAML, crear Secrets, definir Services, Ingress y, en caso de bases de datos, montar operadores adicionales. Cuando el objetivo es ofrecer una experiencia similar a la de plataformas SaaS (Railway, Render) pero bajo control propio, esa complejidad se vuelve un obstáculo. El patrón recurrente es una capa de orquestación que oculte la configuración de bajo nivel mientras mantiene la flexibilidad de Kubernetes. Los síntomas típicos incluyen: ...

August 13, 2026 · Ernesto