Cómo usar modelos LLM de gran contexto para diagnosticar fallas en Kubernetes

Problema En entornos de Kubernetes es frecuente observar picos intermitentes de errores 502 en el API gateway sin una causa visible en los dashboards tradicionales. Los indicadores de CPU, memoria y red pueden permanecer dentro de los umbrales, mientras que los usuarios experimentan caídas breves pero críticas. Este patrón suele deberse a una cascada de eventos que involucra varios subsistemas: jobs programados, Horizontal Pod Autoscaler (HPA), tiempos de gracia en los shutdowns y colas en el ingress. Cuando cada pieza genera datos en fuentes distintas (logs de pods, series de tiempo de Prometheus, hilos de Slack, tickets de JIRA), el proceso manual de correlación se vuelve laborioso y propenso a errores. ...

June 28, 2026 · Ernesto

Cómo mejorar la efectividad de tu resume para roles de Azure IAM y Cloud Security

Problema Muchos ingenieros especializados en Azure IAM, Microsoft Entra ID y seguridad en la nube dedican tiempo a construir infraestructuras complejas, pero cuando publican su curriculum, la respuesta de los reclutadores es escasa o nula. El patrón es recurrente: el CV contiene mucha jerga técnica, listas extensas de herramientas y logros cuantificados, pero sigue sin generar entrevistas. El problema no es la falta de experiencia; es la forma en que esa experiencia se comunica y se alinea con los criterios de selección de los equipos de contratación de Azure. ...

June 27, 2026 · Ernesto

Cómo solucionar errores de creación de EC2 Instance en AWS

Problema En entornos de infraestructura como código (IaC) es frecuente que el despliegue de una EC2 Instance falle con un mensaje de error 400 que indica que la cuenta está bloqueada o no es reconocida como válida. El mensaje típico incluye “Blocked: This account is currently blocked and not recognized as a valid account”. El fallo ocurre tanto con Terraform como con la consola web, y se presenta antes de que se alcance cualquier límite de cuota o de capacidad. El síntoma es inmediato: la llamada RunInstances devuelve un error y la instancia nunca se crea. ...

June 27, 2026 · Ernesto

Lecciones aprendidas al migrar a multi‑cloud (Azure + AWS) después de 6 meses

Problema Muchas organizaciones que empezaron en un único proveedor (Azure o AWS) se ven obligadas a operar en ambos por fusiones, requisitos regulatorios o la necesidad de usar servicios exclusivos. El patrón que surge es una infraestructura fragmentada: cada equipo mantiene su propio conjunto de herramientas, configuraciones de red y políticas de identidad. El resultado típico es: Duplicación de esfuerzos de despliegue. Falta de visibilidad única sobre métricas y alertas. Inconsistencias de seguridad entre los proveedores. Incremento de costos operacionales y de licencia. En estos setups suele pasar que la presión por “abstraer la nube” lleva a crear capas de compatibilidad que terminan siendo más un lastre que una solución. ...

June 27, 2026 · Ernesto

Cómo añadir SSO con AWS ALB + Entra ID a aplicaciones sin autenticación

Problema En entornos internos es frecuente encontrar herramientas auto‑hosteadas, scripts rápidos o dashboards creados por equipos que no incluyen un mecanismo de autenticación robusto. Algunas aplicaciones solo exponen un formulario básico, otras ni siquiera solicitan credenciales. Cuando el número de servicios crece, añadir OIDC o SAML a cada uno se vuelve costoso: hay que modificar código, recompilar contenedores y mantener librerías de autenticación en varios lenguajes. El resultado es una superficie de ataque innecesaria y una experiencia de usuario inconsistente, sobre todo cuando la organización ya dispone de un IdP corporativo (Microsoft Entra ID, Azure AD, etc.) con MFA y políticas de acceso condicional. ...

June 26, 2026 · Ernesto

Cómo comparar y optimizar pipelines de ingestión de logs con Logstash vs Rust en AWS Graviton

Problema Los pipelines de ingestión de logs son el cuello de botella de muchas arquitecturas de observabilidad. En entornos basados en AWS, la tendencia es lanzar instancias Graviton (ARM) para reducir la factura, pero la mayoría de los agentes tradicionales, como Logstash, siguen ejecutándose sobre la JVM. La combinación de alto consumo de RAM, tiempos de arranque lentos y licencias de software puede hacer que el costo total supere el beneficio esperado del hardware más barato. ...

June 26, 2026 · Ernesto

Cómo diagnosticar tickets Kerberos con sesión RC4 en entornos AD

Problema En entornos con controladores de dominio Windows Server 2022 o superiores, Microsoft está eliminando RC4 como algoritmo de cifrado para Kerberos. La directiva RC4DefaultDisablementPhase = 2 indica que el controlador ya no debe generar claves de sesión RC4, pero en la práctica se siguen observando eventos 4769 donde el Ticket Encryption Type es AES (0x12) y el Session Encryption Type es RC4 (0x17). Este comportamiento se produce típicamente cuando un equipo (a menudo un appliance o un servidor Linux con Kerberos cliente) solicita un ticket TGT (krbtgt) y, pese a que la cuenta de equipo está configurada para AES‑128/256 únicamente (msDS-SupportedEncryptionTypes = 0x18), el controlador devuelve una clave de sesión RC4. El síntoma más visible son los eventos 4769 con “Session Encryption Type = 0x17” y la imposibilidad de pasar a una fase de pruebas sin RC4 sin que el cliente falle. ...

June 26, 2026 · Ernesto

Cómo evitar que “works in my Azure subscription” no sea desplegable en Azure

Problema En muchos proyectos de IA y micro‑servicios en Azure se construye un entorno que funciona perfectamente en la suscripción del autor, pero falla al intentar replicarlo en una cuenta limpia. El patrón típico es que la infraestructura depende de configuraciones implícitas: extensiones de PostgreSQL ya instaladas, nombres de secretos que coinciden con recursos creados manualmente, o rutas de archivos locales que sólo existen en la máquina del desarrollador. Cuando otro equipo o un pipeline de CI/CD intenta desplegar el mismo código, aparecen errores de “resource not found”, “invalid secret name” o “extension not allowed”. El resultado es una solución que no es verdaderamente portable y que requiere intervención manual para cada nueva suscripción. ...

June 23, 2026 · Ernesto

Cómo diagnosticar y solucionar fallos silenciosos en self‑hosted GitHub Actions runners en EKS

Problema Los pipelines de CI/CD que usan self‑hosted GitHub Actions runners dentro de un clúster EKS pueden quedar en estado “Waiting for a runner” o consumir recursos inesperados sin que aparezca ningún error en los logs. El síntoma típico es que los pods del runner aparecen “Running”, reportan “Connected to GitHub”, pero los jobs nunca se asignan. En otros casos los nodos se provisionan con el tipo de instancia equivocado (on‑demand en lugar de Spot) o la infraestructura completa se vuelve inestable cuando el clúster escala a cero. Estos fallos son “silenciosos”: el control plane muestra verde, pero la causa real está oculta en configuraciones de IAM, Helm, taints o en la interacción entre Karpenter y Terraform. ...

June 15, 2026 · Ernesto

Cómo identificar al propietario de recursos AWS sin tags fiables

Problema En entornos con varios equipos, es habitual encontrarse con recursos de AWS que carecen de tags de propietario o que presentan información desactualizada. La ausencia de metadatos fiables dificulta responder preguntas como: ¿Quién creó esta instancia EC2?, ¿A qué proyecto pertenece este bucket S3? o ¿Quién mantiene este rol IAM? La falta de claridad genera retrasos en auditorías, en la gestión de costos y en la resolución de incidentes. Además, cuando los equipos rotan, la pista de “dueño” se vuelve aún más difusa, lo que obliga a los ingenieros a invertir tiempo en “arqueología” de Slack, documentos internos o correos. ...

June 13, 2026 · Ernesto