Cómo diseñar y optimizar un homelab con GPU passthrough y alta capacidad de RAM en Proxmox

Problema En muchos homelabs el crecimiento rápido genera dos cuellos de botella habituales: capacidad de memoria insuficiente para ejecutar varios laboratorios simultáneos y acceso a GPU para workloads de IA o renderizado dentro de VMs. Cuando el hardware se reparte entre una workstation (Xeon) y una PC de escritorio (Intel Core Ultra), la arquitectura de la placa base y la configuración de IOMMU pueden impedir que la GPU sea asignada de forma estable a una VM. Además, la mezcla de canales de RAM (dual‑channel vs quad‑channel) y la falta de balanceo pueden degradar el rendimiento de los servicios críticos (SIEM, firewalls, controladoras de red). El desafío es diseñar una arquitectura que permita: ...

September 4, 2026 · Ernesto

Cómo diagnosticar BSOD IRQL_NOT_LESS_OR_EQUAL y WHEA en Windows 11 con CPUs Intel

Problema En plataformas con procesadores Intel híbridos (P‑cores + E‑cores) y placas base Z790, es frecuente observar reinicios inesperados bajo Windows 11. Los síntomas típicos incluyen: BSOD con código IRQL_NOT_LESS_OR_EQUAL (0xA) cuyo stack apunta a nt!KiUpdateThreadHgsFeedback. BSOD con HYPERVISOR_ERROR (0x20001). Eventos WHEA que reportan Generic Processor Error y Cache Error en los niveles de ejecución de instrucción. Los fallos aparecen cuando los ocho P‑cores están activos, pero desaparecen al desactivar uno de ellos (reducción a 7 P‑cores → 26 hilos lógicos). La inestabilidad persiste pese a desactivar Hyper‑V, limpiar servicios de terceros y ejecutar pruebas en modo seguro. ...

September 1, 2026 · Ernesto

Cómo solucionar Kernel Panic y errores de compilación DKMS en Ubuntu tras actualizar el kernel

Problema En sistemas Ubuntu que usan controladores propietarios (NVIDIA) o módulos externos (v4l2loopback), una actualización del kernel puede dejar el arranque inutilizable. El síntoma típico es Kernel Panic con el mensaje: VFS: Unable to mount root fs on unknown-block(0,0) Este error indica que el initrd generado para el nuevo kernel no contiene los módulos críticos (por ejemplo, nvidia.ko, v4l2loopback.ko). Cuando DKMS no logra compilar esos módulos contra la nueva versión del kernel, mkinitramfs los omite y el sistema no puede montar la raíz. ...

September 1, 2026 · Ernesto

Cómo diagnosticar y solucionar BSODs de SYSTEM_PTE_MISUSE y BAD_SYSTEM_CONFIG_INFO en Windows 11

Problema Los usuarios de Windows 11 a veces se encuentran con pantallas azules (BSOD) que aparecen a los pocos segundos de iniciar el sistema. Los códigos de detención más habituales en este escenario son SYSTEM_PTE_MISUSE (0xDA) y BAD_SYSTEM_CONFIG_INFO (0x74). El síntoma típico es: El equipo arranca, muestra la pantalla de inicio de sesión y, en menos de 10 segundos, se produce el BSOD. Reiniciar lleva al mismo resultado, incluso después de una reinstalación limpia del SO. Los fallos reaparecen tras la primera ronda de actualizaciones de Windows, especialmente cuando se instala o se intenta pausar Windows Update. Este patrón indica que algo que se carga muy temprano en el arranque (controlador, firmware o configuración de BIOS) está corrupto o es incompatible, y que Windows Update tiende a reinstalarlo automáticamente. ...

August 29, 2026 · Ernesto

Cómo optimizar refrigeración y espacio en racks DIY para homelab

Problema En muchos homelabs compactos el chasis, la disposición de los discos y la falta de ventilación provocan temperaturas críticas en la CPU y en los SSDs. Cuando el rack se coloca “sideways” bajo una repisa, el flujo de aire natural se corta y los ventiladores de los servidores no pueden expulsar el calor de manera eficiente. El síntoma típico es que la CPU se acerca a los 90 °C bajo carga, los discos emiten ruidos de alta velocidad y el sistema dispara throttling o apagados de emergencia. El problema no es exclusivo de un modelo de caja; ocurre siempre que el espacio disponible es limitado y la ventilación no se diseña pensando en la orientación horizontal. ...

August 29, 2026 · Ernesto

Cómo montar un laboratorio de IA autoalojado con KVM GPU passthrough

Problema Los ingenieros que entrenan modelos de lenguaje, ejecutan inferencias de 70 B + parámetros o corren contenedores de inferencia suelen recurrir a servicios en la nube. El coste mensual y la dependencia de APIs externas son obstáculos cuando se busca experimentar sin compromisos financieros ni de privacidad. La necesidad típica es disponer de una GPU dedicada que pueda ser usada tanto por una máquina virtual (para aplicaciones Windows) como por contenedores Linux en el mismo host, todo dentro de la red doméstica. ...

August 28, 2026 · Ernesto

Cómo eliminar dispositivos pci-bridge para evitar el error ACPI_BIOS_ERROR 0xA5 en GPU passthrough con Proxmox

Problema En entornos de virtualización con Proxmox, es frecuente intentar pasar una GPU dedicada a una VM Windows (XP, 7 o versiones más recientes) usando PCI passthrough. Cuando la máquina virtual se basa en el modelo de máquina i440fx, algunos usuarios se encuentran con un bucle de reinicio que termina en el STOP: 0x000000A5 (ACPI_BIOS_ERROR). El síntoma típico es un bootloop continuo, sin que la VM llegue a cargar el sistema operativo. Aunque el error parece estar relacionado con la BIOS del invitado, la causa raíz a menudo está en la configuración de la VM y no en la propia GPU. ...

August 27, 2026 · Ernesto

Cómo diagnosticar y solucionar errores de NX / SVM / NPT ocultos en BIOS que impiden Hyper‑V y WSL2

Problema En entornos Windows 11 con procesadores AMD, es frecuente encontrarse con la imposibilidad de iniciar Hyper‑V o una distribución WSL2. Los síntomas típicos son: HCS_E_HYPERV_NOT_INSTALLED o “virtualization is not enabled”. systeminfo muestra Virtualization Enabled In Firmware: Yes, pero coreinfo indica que los flags NX, SVM y NP están desactivados. Los logs de Hyper‑V reportan el error ID 44: Hypervisor launch failed; Either VMX not present or not enabled in BIOS. La BIOS tiene la opción SVM marcada como Enabled y, sin embargo, el hipervisor no se detecta. Este patrón aparece en mini‑PCs, notebooks OEM y placas madre de fabricantes poco documentados, donde el firmware oculta deliberadamente o por error los bits de CPUID que exponen las capacidades de ejecución sin‑ejecución (NX), virtualización asistida (SVM/AMD‑V) y tablas de páginas anidadas (NPT/SLAT). El resultado es que Windows cree que la virtualización está disponible, pero el hipervisor no puede usarla. ...

August 26, 2026 · Ernesto

Cómo migrar un clúster Kubernetes de x86 a arm64 en homelab

Problema Los entornos homelab cada vez incorporan servidores basados en ARM, pero la mayoría de los manifiestos, operadores y pipelines siguen diseñados para x86. Cuando se sustituye el hardware tradicional por nodos Ampere Q80‑30 o similares, aparecen fallos de compatibilidad: imágenes sin soporte arm64, CRDs que asumen arquitectura x86, y políticas de scheduling que no distribuyen correctamente los pods. El síntoma típico es que el clúster arranca, pero varios componentes (por ejemplo, ClickHouse Operator o Harbor) no se despliegan, o los pods quedan en Pending con mensajes de “no matching node”. ...

August 25, 2026 · Ernesto

Cómo migrar un servidor Proxmox con SSD fallida a un Mini PC: hardware, QoL y mejores prácticas

Problema En entornos de homelab es frecuente montar Proxmox VE sobre hardware reutilizado: portátiles antiguos, mini PCs o servidores de segunda mano. Cuando el disco principal (usualmente un SSD SATA o NVMe) falla, el host entra en modo solo‑lectura o no arranca, provocando pérdida de disponibilidad de los contenedores LXC y máquinas virtuales. El síntoma típico es un error de I/O en el sistema de archivos, seguido de un POST que indica “Detection error on HDD0” y la caída al arranque por red (PXE). El reto es dos veces: (1) migrar la carga de trabajo a un nuevo nodo de bajo consumo sin interrumpir los servicios, y (2) evitar que el nuevo almacenamiento sufra el mismo desgaste prematuro. ...

August 25, 2026 · Ernesto