Cómo desplegar una stack de microservices con PostgreSQL, Kafka y observability en Kubernetes barato

Problema Los estudiantes y desarrolladores que están aprendiendo a orquestar microservicios suelen terminar con un clúster local (por ejemplo, kind) y preguntarse cómo trasladar esa arquitectura a la nube sin que la factura se dispare. El reto típico incluye: Cinco servicios Node.js empaquetados como contenedores. Bases de datos PostgreSQL dedicadas por servicio, además de Redis y Kafka. Pilas de observabilidad (Prometheus, Grafana, Loki, Alloy) desplegadas mediante Helm. Necesidad de automatizar la provisión con Terraform para poder crear, grabar demos y destruir el entorno rápidamente. En entornos reales, los equipos deben equilibrar tres variables: coste, complejidad operativa y alineación con prácticas de producción. La pregunta central es cuál es la combinación de servicios gestionados y auto‑gestionados que permite mantener el gasto bajo y, al mismo tiempo, demostrar habilidades que interesen a reclutadores. ...

September 10, 2026 · Ernesto

Cómo evolucionar de Cloud Ops a un rol sólido de DevOps/SRE en AWS

Problema Muchos ingenieros que gestionan operaciones en la nube pasan gran parte del tiempo en alertas, tickets y scripts de mantenimiento. Cuando intentan escalar a roles de DevOps o SRE, se encuentran con una brecha: los proyectos que construyen a menudo son demostraciones aisladas que lucen bien en un CV, pero no demuestran profundidad operativa ni capacidad para gestionar SLOs, resiliencia y escalado real. El reto es definir una hoja de ruta que combine amplitud (conocer varias piezas del ecosistema AWS) y profundidad (dominar observabilidad, automatización de incidentes y gestión de confiabilidad) sin caer en “resume‑bait”. ...

September 3, 2026 · Ernesto

Cómo automatizar la recuperación de recursos críticos en la nube con Terraform y GitHub Actions

Problema En entornos de producción es habitual depender de servicios gestionados (Blob storage, bases de datos, colas, etc.) que se encuentran en una única región o proveedor. Cuando uno de esos recursos sufre una interrupción —por ejemplo, una caída del servicio de Azure Blob en “East US”— la aplicación deja de responder y el equipo de guardia puede no estar disponible. La pregunta central es: ¿cómo reaccionar de forma automática, sin introducir deriva de configuración y sin depender de procesos manuales? ...

August 31, 2026 · Ernesto

Cómo pasar de CSIRT Lead a Security Engineer: habilidades clave y brechas comunes

Problema Muchos profesionales que han pasado años en operaciones de TI, SOC y CSIRT llegan a un punto donde el rol de Security Engineer parece el siguiente paso natural. El desafío no es solo “cambiar de título”, sino cerrar brechas de habilidades que el día a día del SOC no suele exigir: scripting avanzado, infraestructura como código (IaC), automatización de pipelines y un dominio profundo de la nube. La pregunta recurrente es: ¿mi experiencia actual me permite competir por puestos de ingeniero de seguridad de nivel medio? y, de no ser así, ¿qué debo aprender primero? ...

August 31, 2026 · Ernesto

Cómo auditar y evitar que SAML/OIDC pasen a planes pagos en aplicaciones self‑hosted

Problema En entornos self‑hosted es habitual confiar en que una funcionalidad crítica, como SAML o OpenID Connect (OIDC), esté disponible sin coste adicional. Cuando un proveedor decide mover esa funcionalidad a una edición de pago, la actualización automática rompe la integración de SSO y obliga a los usuarios a migrar a planes más caros o a buscar alternativas. El patrón se repite en varias aplicaciones: una versión gratuita incluye SSO, una actualización posterior la elimina o la restringe, y el administrador se queda sin acceso de autenticación única. El problema no es aislado; cualquier stack que dependa de SSO está expuesto a regresiones de características cuando los proyectos cambian su modelo de negocio o su hoja de ruta. ...

August 30, 2026 · Ernesto

Cómo diagnosticar fallos de outbound HTTPS en OCI y entornos similares

Problema En entornos de producción basados en OCI (Oracle Cloud Infrastructure) o cualquier nube pública, es frecuente que una instancia en una subnet pública necesite acceder a APIs externas mediante HTTPS. Cuando la conectividad falla de forma intermitente o total, los síntomas típicos son: curl https://api.ejemplo.com nunca devuelve una respuesta, se agota el timeout de conexión. Descargas de paquetes (apt update, yum install) fallan aleatoriamente. Algunas URLs (GitHub, PECL) funcionan sin problemas, mientras que otras (Fastly, servicios de IA) presentan pérdida de paquetes desde el primer salto fuera del edge de la nube. Herramientas de diagnóstico como mtr o traceroute muestran que los primeros dos hops (edge de OCI y el punto de handoff del ISP) son 0 % loss, pero a partir del tercer hop la pérdida sube a 100 % o a valores altos. El patrón es claro: la ruta está intacta dentro de la VCN, el problema aparece en la capa de tránsito regional o de peering con el ISP del datacenter. Este tipo de “blackhole” suele afectar sólo a ciertos rangos de IP (por ejemplo, bloques de Fastly o de un proveedor de IA) y no a la internet en general. ...

August 30, 2026 · Ernesto

Cómo evaluar candidatos sin experiencia de producción para roles de Linux / Infrastructure

Problema Muchas empresas buscan ingenieros de infraestructura que dominen Linux, automatización con Ansible/Terraform y conceptos de SRE, pero al mismo tiempo exigen experiencia en producción, on‑call y gestión de incidentes reales. Los candidatos autodidactas con homelabs robustos a menudo se encuentran frente a una pared: su CV muestra proyectos complejos, pero carece de la palabra “producción”. Los reclutadores y líderes de equipo deben decidir si esa falta de experiencia es un obstáculo insalvable o si la profundidad técnica compensa la ausencia de historial en entornos críticos. ...

August 30, 2026 · Ernesto

Cómo resolver conflictos de Signed-By al configurar Docker en Ubuntu

Problema Al intentar añadir el repositorio oficial de Docker en una instalación limpia de Ubuntu 26.04, apt devuelve un mensaje similar a: Error: Conflicting values set for option Signed-By regarding source https://download.docker.com/linux/ubuntu/ resolute: /usr/share/keyrings/docker-archive-keyring.gpg != /etc/apt/keyrings/docker.asc Error: The list of sources could not be read. El error indica que la misma fuente APT tiene dos entradas que especifican rutas diferentes para la clave GPG (Signed-By). Cuando apt procesa la lista de fuentes, no puede decidir cuál usar y aborta la operación. ...

August 30, 2026 · Ernesto

Cómo aprender Kubernetes y Helm de forma práctica

Problema Muchos profesionales que recién ingresan al área de DevOps se encuentran con la presión de manejar Kubernetes y Helm sin una hoja de ruta clara. La abundancia de tutoriales, libros y certificaciones genera una sensación de “todo o nada”: ¿debo leer la teoría primero o lanzarme a los laboratorios? ¿Qué conceptos son críticos y cuáles pueden esperar? El resultado típico es pasar horas en documentación que no se traduce en habilidades operativas, o bien invertir tiempo en detalles superficiales mientras se ignoran fundamentos que, al final, provocan errores de configuración y pérdida de productividad. ...

August 26, 2026 · Ernesto

Cómo diagnosticar y solucionar problemas de WMI filters en Group Policy

Problema En entornos con Active Directory, los filtros WMI se usan para limitar la aplicación de un GPO a equipos que cumplen una condición. Cuando se elimina un filtro sin antes desvincularlo de los GPO que lo usan, esos GPO quedan con una referencia interna (gPCWQLFilter) que apunta a un objeto inexistente. El resultado típico es que la política aparece como “Denied” en gpresult o en el visor de eventos, con el mensaje “WMI filter”. El GPO sigue existiendo, pero nunca se aplica porque el motor de Group Policy interpreta la referencia faltante como una denegación implícita. ...

August 26, 2026 · Ernesto