Cómo saber si enfocarse solo en on‑prem Kubernetes sin AWS/Azure perjudica tu carrera DevOps

Problema Muchos ingenieros junior dedican su tiempo a montar clústers de Kubernetes en servidores propios, usando herramientas como K3s, Cilium, ArgoCD o Longhorn. La inquietud surge cuando el mercado laboral pide experiencia en los grandes proveedores de nube (AWS, Azure, GCP). La pregunta central es si una carrera centrada exclusivamente en infraestructura on‑prem puede quedar rezagada frente a perfiles que manejan servicios gestionados en la nube, y cómo equilibrar ambos mundos sin perder profundidad técnica. ...

June 5, 2026 · Ernesto

Cómo solucionar fallos intermitentes de Azure Functions al subir archivos >30 MB

Problema En entornos de producción es frecuente que una Azure Function expuesta vía HTTP reciba archivos desde un cliente web. Cuando el tamaño del payload supera los 30 MB, los desarrolladores observan respuestas intermitentes: a veces la carga finaliza con éxito, otras veces la petición termina con error 500 o 408. El comportamiento es aleatorio, no depende del cliente ni del tipo de archivo, y ocurre solo en producción; en local la función acepta archivos de 100 MB sin inconvenientes. Este patrón indica que algo en la cadena de ejecución (plano de Azure Functions, red, autenticación o Blob Storage) está imponiendo restricciones que no se reflejan en el entorno de desarrollo. ...

June 4, 2026 · Ernesto

Cómo lograr trazabilidad de errores end‑to‑end en Azure Functions y servicios asociados

Problema En arquitecturas compuestas por Azure Functions, Cosmos DB, Service Bus, LLMs y callbacks externos, la visibilidad de una solicitud completa suele fragmentarse. Cada componente escribe en su propio espacio de logging y, aunque todos comparten un identificador de ejecución (por ejemplo execution_id), los ingenieros deben abrir varios recursos de Application Insights, buscar en tablas de Log Analytics y correlacionar manualmente los eventos. El resultado es: tiempos de diagnóstico de 20‑40 minutos, ejecuciones que quedan “atascadas” en el Change Feed o en colas, fallos de callbacks que no se detectan hasta que el cliente reclama, falta de contexto para determinar si el problema es global, por tenant o por tipo de petición. Este patrón se repite en cualquier pipeline serverless donde varios servicios Azure interactúan y donde la latencia de los componentes externos (LLM, APIs de terceros) es variable. ...

June 3, 2026 · Ernesto

Cómo reducir un EBS volume sobre‑expandido sin migración completa

Problema En entornos de producción auto‑gestionados es frecuente que un contenedor o proceso genere archivos inesperados (logs, dumps, archivos temporales) que llenan rápidamente el disco. La reacción típica es ampliar el volumen subyacente (por ejemplo, un EBS de 250 GB a 1.5 TB) para evitar que el servicio se caiga. Una vez eliminado el exceso de datos, el uso real vuelve a ser mucho menor, pero el coste del volumen sigue basado en su tamaño máximo. El desafío es reducir el tamaño lógico del volumen sin perder datos ni interrumpir servicios críticos, algo que los sistemas de archivos ext4 y xfs no permiten de forma directa en producción. ...

June 1, 2026 · Ernesto

Cómo migrar de Azure a Hetzner y reducir costos en infraestructuras Kubernetes

Problema Muchas startups y equipos de DevOps empiezan su stack en un hyperscaler (Azure, AWS, GCP) porque el crédito inicial y la facilidad de aprovisionamiento son atractivos. Con el tiempo, la factura crece: nodos de Kubernetes, balanceadores, CDN, funciones serverless y bases de datos gestionadas. La arquitectura suele estar diseñada para evitar el lock‑in a nivel de API, pero el modelo de precios de los proveedores sigue siendo exponencial. El patrón recurrente es alto gasto operativo con poca diferenciación funcional. Cuando el presupuesto se vuelve crítico, el equipo necesita una alternativa que mantenga la disponibilidad y la capacidad de escalar, pero con un modelo de costos lineal y sin dependencias propietarias. ...

May 30, 2026 · Ernesto

Cómo diagnosticar y solucionar problemas de Terraform en Azure DevOps pipelines con IAM

Problema En entornos donde los equipos gestionan infraestructura como código con Terraform dentro de Azure DevOps, es frecuente que los pipelines fallen de forma intermitente o constante. El patrón típico incluye errores de autorización (403, AccessDenied), fallos al ejecutar terraform plan o apply, y mensajes que hacen referencia a recursos tanto de Azure como de AWS. El problema no se limita a un proyecto concreto; ocurre siempre que se combinan: ...

May 29, 2026 · Ernesto

Cómo usar un emulador AWS de un solo binario en pipelines CI/CD

Problema En entornos de desarrollo y CI/CD que dependen de servicios AWS, es frecuente encontrarse con tres limitaciones: Costos – Ejecutar pruebas contra la nube real implica cargos por uso, lo que escala rápidamente con la cantidad de builds. Velocidad – Los recursos remotos añaden latencia; los pipelines se alargan y el feedback para los desarrolladores se retrasa. Cobertura – Herramientas gratuitas o de comunidad a menudo no implementan el conjunto completo de APIs, lo que obliga a escribir pruebas que sólo cubren un subconjunto de la funcionalidad real. El patrón que se repite es la necesidad de un entorno AWS local que sea rápido, completo y sin costes ocultos, capaz de integrarse tanto en máquinas locales como en clústers Kubernetes usados por los pipelines. Cuando la solución no cumple con alguno de esos requisitos, los equipos terminan combinando varios emuladores, scripts de arranque y contenedores Docker, lo que genera complejidad y puntos de falla. ...

May 29, 2026 · Ernesto

Cómo validar configuraciones de AWS para cumplir con los controles SOC 2 usando una CLI open source

Problema Los equipos que gestionan entornos AWS suelen recibir auditorías SOC 2 que exigen configuraciones específicas: MFA obligatorio en usuarios IAM, CloudTrail activo en todas las regiones, buckets S3 sin acceso público, entre otros. En la práctica, esas configuraciones se pierden con cambios de infraestructura, despliegues automáticos o simplemente por desconocimiento. Cuando la auditoría llega, los hallazgos aparecen como “control no cumplido” y el equipo debe reaccionar bajo presión. La raíz del problema es la falta de una verificación continua y enfocada en los controles SOC 2, no un escaneo genérico de seguridad. ...

May 29, 2026 · Ernesto

Cómo manejar respuestas y timeouts de Adaptive Card en Azure Logic Apps

Problema En muchos procesos de aprobación o verificación se necesita enviar una Adaptive Card a Teams y esperar una respuesta del usuario. La acción Post adaptive card and wait for a response permite definir un timeout (por ejemplo, PT2M). Cuando el usuario pulsa el botón, la salida contiene el submitActionId; cuando el timeout ocurre, la salida es nula y el estado de la acción pasa a TimedOut. El desafío aparece al intentar encadenar una condición que evalúe ambos escenarios dentro de un bucle Until. Si la condición intenta leer body('Post_adaptive_card_and_wait_for_a_response')['submitActionId'] cuando la tarjeta expiró, el motor lanza InvalidTemplate porque la propiedad no existe. El resultado es un flujo que se detiene antes de poder enviar recordatorios o marcar la tarea como completada. ...

May 27, 2026 · Ernesto

Cómo proteger GitHub Actions contra ataques de supply chain tipo Megalodon

Problema Los pipelines de CI/CD son cada vez más atractivos para los atacantes porque, una vez dentro, pueden ejecutar código con los mismos privilegios que el propio runner. Un patrón recurrente es la inserción de workflow maliciosos que imitan a bots de CI (por ejemplo build-bot o auto-ci) y que roban secretos, credenciales de nube y tokens OIDC. Cuando el atacante controla un workflow que se dispara en cada push o mediante workflow_dispatch, puede exfiltrar datos en cada ejecución y, con un token OIDC válido, obtener acceso directo a los proveedores de nube sin necesidad de credenciales estáticas. ...

May 25, 2026 · Ernesto