Cómo montar un laboratorio de IA autoalojado con KVM GPU passthrough

Problema Los ingenieros que entrenan modelos de lenguaje, ejecutan inferencias de 70 B + parámetros o corren contenedores de inferencia suelen recurrir a servicios en la nube. El coste mensual y la dependencia de APIs externas son obstáculos cuando se busca experimentar sin compromisos financieros ni de privacidad. La necesidad típica es disponer de una GPU dedicada que pueda ser usada tanto por una máquina virtual (para aplicaciones Windows) como por contenedores Linux en el mismo host, todo dentro de la red doméstica. ...

August 28, 2026 · Ernesto

¿Es un business-class NAS suficiente como shared storage para un pequeño cluster Proxmox de 2 nodos?

Problema Muchas pymes y laboratorios de TI necesitan un entorno de virtualización de alta disponibilidad con un presupuesto limitado. Un escenario típico es un cluster Proxmox de dos nodos que ejecuta varios servicios críticos (AD, bases de datos, aplicaciones web) y que requiere un storage compartido para migraciones en vivo y failover rápido. La pregunta central es si un business‑class NAS puede reemplazar una arquitectura basada en discos locales con ZFS y replicación, manteniendo un RPO aceptable y sin introducir cuellos de botella. El problema se repite en cualquier despliegue donde: ...

August 27, 2026 · Ernesto

Cómo eliminar dispositivos pci-bridge para evitar el error ACPI_BIOS_ERROR 0xA5 en GPU passthrough con Proxmox

Problema En entornos de virtualización con Proxmox, es frecuente intentar pasar una GPU dedicada a una VM Windows (XP, 7 o versiones más recientes) usando PCI passthrough. Cuando la máquina virtual se basa en el modelo de máquina i440fx, algunos usuarios se encuentran con un bucle de reinicio que termina en el STOP: 0x000000A5 (ACPI_BIOS_ERROR). El síntoma típico es un bootloop continuo, sin que la VM llegue a cargar el sistema operativo. Aunque el error parece estar relacionado con la BIOS del invitado, la causa raíz a menudo está en la configuración de la VM y no en la propia GPU. ...

August 27, 2026 · Ernesto

Cómo diagnosticar y solucionar errores de NX / SVM / NPT ocultos en BIOS que impiden Hyper‑V y WSL2

Problema En entornos Windows 11 con procesadores AMD, es frecuente encontrarse con la imposibilidad de iniciar Hyper‑V o una distribución WSL2. Los síntomas típicos son: HCS_E_HYPERV_NOT_INSTALLED o “virtualization is not enabled”. systeminfo muestra Virtualization Enabled In Firmware: Yes, pero coreinfo indica que los flags NX, SVM y NP están desactivados. Los logs de Hyper‑V reportan el error ID 44: Hypervisor launch failed; Either VMX not present or not enabled in BIOS. La BIOS tiene la opción SVM marcada como Enabled y, sin embargo, el hipervisor no se detecta. Este patrón aparece en mini‑PCs, notebooks OEM y placas madre de fabricantes poco documentados, donde el firmware oculta deliberadamente o por error los bits de CPUID que exponen las capacidades de ejecución sin‑ejecución (NX), virtualización asistida (SVM/AMD‑V) y tablas de páginas anidadas (NPT/SLAT). El resultado es que Windows cree que la virtualización está disponible, pero el hipervisor no puede usarla. ...

August 26, 2026 · Ernesto

Cómo aislar runners auto‑hosteados de GitHub Actions con capacidad Docker

Problema Los runners auto‑hosteados de GitHub Actions son convenientes porque pueden reutilizar infraestructura existente y ejecutar jobs que requieren Docker, Docker‑Compose o herramientas de navegador como Playwright. Sin embargo, cuando el job tiene acceso directo al daemon Docker del host, se rompe el aislamiento esperado: un script malintencionado o un error de configuración puede manipular contenedores del propio host, leer volúmenes sensibles o consumir recursos críticos. Además, la ejecución de código del workflow directamente sobre la máquina física elimina la frontera entre el CI y el entorno de producción, lo que complica la depuración y la rotación de runners. ...

August 24, 2026 · Ernesto

Cómo solucionar problemas de temas CSS en la UI web de Proxmox y otras interfaces ExtJS

Problema En entornos de homelab y virtualización es frecuente personalizar la interfaz web de herramientas como Proxmox, OpenNebula o cualquier aplicación construida sobre ExtJS. El objetivo es mejorar la estética o adaptar colores a un esquema propio. Sin embargo, al aplicar un tema CSS se pueden presentar dos síntomas recurrentes: Confusión entre fila seleccionada y fila bajo el cursor – los estilos :hover y .x-grid-item-selected comparten la misma regla de color, de modo que el usuario no distingue qué elemento está realmente activo. Rotura del layout después de una actualización del paquete – el instalador del tema guarda una copia del archivo CSS original y la restaura en cada upgrade. Si la actualización incluye un nuevo stylesheet, el script sobrescribe el nuevo archivo con la copia antigua, dejando la UI “pegada” a una versión obsoleta del tema base. Estos problemas no son exclusivos de Proxmox; cualquier aplicación que dependa de ExtJS para medir geometría en tiempo de renderizado sufre cuando el tema altera propiedades que afectan al cálculo de tamaños (peso de fuente, letter-spacing, padding, bordes). El resultado son botones con texto recortado, columnas de tabla desalineadas o sombras que aparecen fuera de lugar. ...

August 23, 2026 · Ernesto

Cómo diagnosticar y solucionar desconexiones inmediatas de Azure Virtual Desktop con Windows Cloud Login

Problema En entornos de Azure Virtual Desktop (AVD) que usan Windows Cloud Login (WCL) y están unidos a Microsoft Entra ID, es frecuente observar que la sesión se cierra en el mismo segundo en que se establece. El cliente (Windows App o web) muestra dos solicitudes de autenticación: la primera finaliza con éxito, la segunda devuelve errores como 50033 / temporarily_unavailable, 50000 o AADSTS54005. El resultado es una desconexión instantánea o un bucle de reintentos que nunca llega a una sesión estable. ...

August 21, 2026 · Ernesto

Cómo diseñar una arquitectura de alta disponibilidad con Proxmox, ZFS y MySQL para entornos críticos

Problema Los entornos de atención médica manejan datos sensibles y flujos de trabajo que no pueden interrumpirse. En muchos casos la infraestructura sigue siendo una combinación de servidores legacy (PHP + Apache + FastCGI) y hardware de escritorio que no está pensado para operar 24 horas al día, 7 días a la semana. Cuando la carga alcanza cientos de usuarios concurrentes y la tolerancia a fallos es cero, la falta de redundancia, de replicación de datos y de un plan de recuperación rápida se vuelve un riesgo inaceptable. El desafío es migrar a una arquitectura de alta disponibilidad (HA) que sea manejable por un equipo pequeño, que aproveche tecnologías de código abierto y que ofrezca recuperación casi en tiempo real para bases de datos críticas como MySQL. ...

August 21, 2026 · Ernesto

Cómo diseñar una arquitectura HA de almacenamiento con Proxmox, ZFS, VirtIO‑SCSI y NFS

Problema Muchas pymes y startups necesitan un storage compartido que ofrezca alta disponibilidad, bajo latencia y alto IOPS, pero no pueden costear soluciones SAN o sistemas de almacenamiento dedicados. El reto típico es combinar servidores de cómputo con discos NVMe locales, exponer esos discos como bloques a una máquina virtual que actúe de NFS y, al mismo tiempo, garantizar que la pérdida de cualquiera de los nodos no interrumpa el servicio. En la práctica, los administradores se preguntan: ...

August 21, 2026 · Ernesto

Cómo diseñar y escalar un homelab multi‑WAN con OPNsense y Proxmox

Problema Los entusiastas de homelab suelen iniciar con una única conexión a Internet y un servidor pequeño. Cuando añaden una segunda línea de fibra, múltiples VLAN, servicios de seguridad, monitorización y contenedores, el consumo de CPU, RAM y ancho de banda crece rápidamente. El patrón que se repite es: sobre‑dimensionar la arquitectura sin una planificación de recursos ni una estrategia de escalado, lo que genera: Saturación de la CPU en el nodo que ejecuta OPNsense y Proxmox simultáneamente. Contención de memoria cuando varios LXC (ntopng, Immich, Paperless, etc.) compiten por los 16 GB disponibles. Ruido y calor excesivo en hardware antiguo, obligando a mover equipos a ubicaciones no ideales. Complejidad de red (dos WAN, VLANs, DNS‑over‑TLS, NTPsec) que se vuelve difícil de depurar sin una base estructurada. El objetivo de la guía es proporcionar un marco reutilizable para planificar, implementar y escalar un homelab multi‑WAN sin caer en los cuellos de botella típicos. ...

August 21, 2026 · Ernesto