Problema
En entornos de homelab es frecuente montar Proxmox VE sobre hardware reutilizado: portátiles antiguos, mini PCs o servidores de segunda mano. Cuando el disco principal (usualmente un SSD SATA o NVMe) falla, el host entra en modo solo‑lectura o no arranca, provocando pérdida de disponibilidad de los contenedores LXC y máquinas virtuales. El síntoma típico es un error de I/O en el sistema de archivos, seguido de un POST que indica “Detection error on HDD0” y la caída al arranque por red (PXE). El reto es dos veces: (1) migrar la carga de trabajo a un nuevo nodo de bajo consumo sin interrumpir los servicios, y (2) evitar que el nuevo almacenamiento sufra el mismo desgaste prematuro.
Causa
Los fallos de SSD en este tipo de setups suelen deberse a una combinación de factores:
- Ciclos de escritura intensiva – Proxmox escribe logs de clúster, snapshots y bases de datos (por ejemplo Immich) de forma continua. En discos de consumo, el TBW (Total Bytes Written) puede agotarse en pocos años si no se controla el nivel de escritura.
- Temperatura constante – Un portátil o mini PC sin disipación adecuada mantiene la SSD cerca de su límite térmico, lo que acelera la degradación de las celdas NAND.
- Controlador SATA envejecido – En equipos antiguos, el controlador integrado puede presentar fallos de señal que aparecen como “error 2100” en el POST.
- Falta de mantenimiento – No ejecutar
fstrimregularmente, no habilitardiscarden el montaje o no monitorizar SMART reduce la vida útil del disco.
Solución
1. Selección de hardware
| Componente | Recomendación genérica | Motivo |
|---|---|---|
| Mini PC Barebone | Caja basada en Intel N100/N97 con al menos dos NIC de 2.5 GbE | Bajo consumo (≈ 6 W), suficiente para Proxmox y varios LXC, y doble NIC permite separar tráfico de gestión y de datos. |
| Memoria | 16 GB DDR4 SODIMM (mínimo) – 32 GB si planeas ejecutar varias VMs simultáneas | Proxmox consume ~1 GB por VM; 16 GB cubre la mayoría de LXC, 32 GB brinda margen para pruebas de bases de datos o entornos de ciberseguridad. |
| NVMe SSD (boot) | 1 TB NVMe con endurance ≥ 600 TBW (p. ej. modelos con SLC/MLC híbrido) | El arranque y los discos de datos de Proxmox se benefician de alta velocidad y mayor resistencia a escrituras. |
| SATA SSD de repuesto | 512 GB SATA SSD con TBW ≥ 300 TBW | Ideal para el T440p reutilizado; suficiente para pruebas y laboratorios. |
| Almacenamiento externo | HDD/SSD portátil 2 TB con conexión USB‑3.0 | Copias de seguridad offline y transporte sencillo. |
2. Configuración de Proxmox para minimizar desgaste
-
Filesystem y montaje
- Usa
ext4oxfscon la opciónnoatimepara evitar escrituras de acceso. - Habilita
discarden los volúmenes NVMe que alojarán contenedores críticos.
- Usa
-
ZFS (opcional)
- Si prefieres ZFS, crea un pool
mirrorcon dos SSD de similar capacidad. - Configura
recordsize=128Kpara bases de datos ylogbias=latency. - Activa
zfs_trimen el cron.
- Si prefieres ZFS, crea un pool
-
Snapshots y backups
- Limita la frecuencia de snapshots a lo necesario; cada snapshot genera escrituras incrementales.
- Programa backups diarios a la unidad externa usando
vzdumpcon compresióngzipozstd.
-
Trim automático
- Programa
fstrimsemanal:
- Programa
# Añade al crontab del root
0 3 * * 0 /sbin/fstrim -av
- Monitorización SMART
- Instala
smartmontoolsy crea alertas por correo cuando el atributoWear_Leveling_Countcaiga bajo 20 %.
- Instala
# Servicio de monitorización simple
#!/bin/bash
THRESH=20
VALUE=$(smartctl -A /dev/nvme0n1 | awk '/Wear_Leveling_Count/ {print $10}')
if (( VALUE < THRESH )); then
echo "SSD wear low: $VALUE%" | mail -s "Proxmox SSD alert" [email protected]
fi
3. Proceso de migración
- Respaldar – Ejecuta
vzdumpde todos los contenedores y VMs a la unidad externa. - Clonar – Conecta el nuevo NVMe al mini PC, instala Proxmox siguiendo la guía oficial y restaura los backups.
- Reconfigurar red – Asigna una NIC a la VLAN de gestión y la otra a la red de datos; guarda la configuración en
/etc/network/interfaces. - Validar – Inicia cada LXC y verifica que los logs de Immich y la base SQLite se monten sin errores.
- Reutilizar T440p – Instala el SSD SATA de repuesto, usa el portátil como nodo de pruebas o como servidor de backups local.
Cuándo aplicar esta solución
- Síntomas: errores de I/O, sistema de archivos en modo read‑only, POST con “Detection error on HDD0”, caída de servicios LXC.
- Entorno: homelab 24/7 con Proxmox VE, uso intensivo de logs y bases de datos, hardware reutilizado o de bajo consumo.
- No aplicable: entornos críticos de producción que requieren discos Enterprise con garantía de 5 años y redundancia RAID‑10; en esos casos la inversión en hardware de clase servidor es obligatoria.
Verificación
- SMART – Ejecuta
smartctl -a /dev/nvme0n1y verifica quePercentage Usedsea bajo (< 10 %). - Montaje –
mount | grep discarddebe mostrar la opcióndiscarden los puntos críticos. - Trim – Ejecuta
fstrim -v /y confirma que el comando devuelve la cantidad de bytes liberados. - Backup – Restaura un contenedor desde la copia externa y verifica su integridad.
- Monitorización – Revisa que el script de alerta SMART envíe correo cuando el umbral se alcance.
Notas adicionales
- Temperatura: coloca el mini PC en un lugar ventilado y considera un disipador de calor para la SSD NVMe; la mayoría de los modelos incluyen sensores que pueden exponer la temperatura mediante
nvme smart-log. - Endurance: la regla práctica es no superar 20 % del TBW anual; con
fstrimsemanal ynoatimepuedes reducir la carga de escritura en un 30‑40 %. - Redundancia: aunque el presupuesto sea limitado, un espejo de dos SSD (mirrored ZFS) cuesta apenas €50‑€70 y protege contra fallos de hardware sin impactar mucho el consumo.
- Actualizaciones de firmware: verifica que el firmware del controlador SATA/NVMe esté al día; en mini PCs de marcas chinas a veces se necesita actualizar vía BIOS.
- Documentación interna: mantén un archivo
README.mden el repositorio de configuración con los pasos de backup y los umbrales de alerta; facilita la recuperación ante futuros incidentes.
Con estas decisiones de hardware, configuraciones de QoL y una rutina de backup automatizada, tu homelab podrá operar de forma estable durante años, incluso con componentes de consumo. La clave está en combinar un nodo de bajo consumo bien ventilado con prácticas de wear‑leveling y monitorización proactiva.