Problema

En infraestructuras con varios sitios que ejecutan Proxmox VE, la rutina de añadir un nuevo nodo suele ser manual: se arranca el servidor, se corre el instalador, se copia la clave de suscripción y, después, se configura el monitoreo de Ceph y la integración de máquinas virtuales en la consola de gestión. Cuando el número de nodos supera unas decenas, esas tareas se convierten en cuellos de botella, generan errores de configuración y hacen que la visión global del estado del cluster sea fragmentada.

Los síntomas típicos son:

  • Instalaciones inconsistentes porque cada operador usa su propio archivo de respuestas.
  • Claves de suscripción dispersas en varios archivos de configuración, lo que dificulta auditorías.
  • Falta de un panel único que muestre la salud de todos los clusters Ceph conectados.
  • Necesidad de abrir varias sesiones web para gestionar VMs que están en diferentes remotos.

El problema no es exclusivo de Proxmox; cualquier entorno de virtualización distribuida sufre cuando la orquestación y la visibilidad están descentralizadas.

Causa

  1. Instalación sin orquestador central – Los instaladores de Proxmox VE siguen siendo “stand‑alone”. Sin un servidor que distribuya respuestas predefinidas, cada nodo depende de la intervención humana.
  2. Gestión de suscripciones aislada – Cada sitio mantiene su propio pool de claves, lo que obliga a copiar manualmente los tokens a los nodos recién creados.
  3. Monitoreo de Ceph externo – Herramientas como Grafana o Prometheus pueden cubrir el aspecto de almacenamiento, pero requieren configuraciones separadas y no aparecen en la UI de Proxmox.
  4. Ausencia de un inventario global de VMs – Proxmox VE muestra los recursos de cada clúster por separado; no hay una vista consolidada de QEMU y LXC en todos los remotos.
  5. Falta de automatismo en la cadena de vida – Operaciones comunes (snapshot, resume, migración) se ejecutan nodo a nodo, lo que aumenta la carga operativa.

Solución

Utilizar Proxmox Datacenter Manager (PDM) como capa de control central. PDM actúa como servidor de configuración, registro de suscripciones y monitor de Ceph, todo desde una única interfaz web. La solución se divide en tres bloques funcionales.

1. Instalación y registro de remotos

  1. Desplegar PDM sobre una máquina Debian 13 (o instalarlo sobre una instalación existente).
  2. Acceder a Settings → Remotes y añadir cada clúster Proxmox VE y cada Proxmox Backup Server mediante su URL y credenciales.
  3. Verificar que la conexión se establece y que el nodo remoto aparece con su versión y estado.

2. Automatización de instalaciones

Crear un “answer file” con los parámetros habituales (disco, red, hostname, etc.) y guardarlo en la sección Automated Installations. Un token de seguridad se genera desde la UI y se incluye en el archivo de arranque del instalador (boot.ipxe o preseed.cfg).

Durante el arranque, el instalador solicita el token; PDM valida la petición y entrega el archivo de respuestas. El proceso avanza sin intervención y, al final, el nodo se registra automáticamente como remoto.

3. Gestión centralizada de suscripciones

En Subscription Registry se importan todas las claves de suscripción que la empresa posee. Cada clave se asigna a un remoto mediante un simple “assign”. Cuando el nodo se provisiona, el instalador incluye la clave asignada y registra la suscripción en el propio Proxmox VE, eliminando la necesidad de pasos manuales posteriores.

4. Monitor de Ceph unificado

Activar la opción Ceph Monitoring en la configuración de cada remoto. PDM recoge métricas de OSD, MON, MGR, MDS y pools y las muestra en un panel consolidado. Los widgets de capacidad y rendimiento permiten detectar rápidamente un OSD fuera de línea o una caída de disponibilidad sin abrir varias consolas.

5. Vista global de invitados

El módulo Cross‑Remote Guests agrega todas las máquinas QEMU y contenedores LXC en una tabla filtrable. Desde allí se pueden iniciar, detener, crear snapshots o reanudar VMs sin cambiar de clúster. La acción “Resume” para VMs pausadas es particularmente útil en despliegues que usan hibernación para ahorrar energía.

Alternativas parciales

Si el entorno no permite instalar PDM (por ejemplo, restricciones de licencia), se pueden combinar:

  • PXE + preseed para la instalación automática.
  • Ansible para distribuir claves de suscripción y aplicar configuraciones post‑instalación.
  • Prometheus + node_exporter para monitorizar Ceph de forma externa.

Estas piezas funcionan, pero carecen de la integración nativa que PDM ofrece.

Cuándo aplicar esta solución

Aplicable cuando:

  • Se gestionan más de dos clústers Proxmox VE o varios servidores de backup en distintas ubicaciones.
  • Se necesita provisionar nodos de forma repetitiva (p.ej., expansión de capacidad o pruebas CI).
  • La empresa posee varios pools de suscripción y requiere auditoría centralizada.
  • Se ejecutan clusters Ceph distribuidos y se desea una vista única de salud y capacidad.

No aplicable en:

  • Laboratorios de una sola máquina donde la sobrecarga de PDM no justifica sus beneficios.
  • Entornos donde la política de seguridad prohíbe la comunicación de los nodos con un servidor central externo.

Código

# 1. Instalar PDM (ISO o paquete .deb)
apt-get update && apt-get install -y proxmox-datacenter-manager

# 2. Generar token para instalaciones automatizadas
pdm-cli token create --name "auto-install-token" --expires-in 30d

# 3. Crear answer file (ejemplo minimal)
cat > /opt/pdm/answers/host01.cfg <<EOF
d-i netcfg/choose_interface select auto
d-i netcfg/get_hostname string host01
d-i partman-auto/method string lvm
d-i partman-auto/choose_recipe select atomic
d-i preseed/early_command string \
  echo "pdm-token=$(pdm-cli token get auto-install-token)" > /target/etc/pdm-token
EOF

# 4. Asignar suscripción a remoto "site‑a"
pdm-cli subscription assign --remote site-a --key ABCD-1234-EFGH-5678

# 5. Habilitar Ceph monitoring para remoto "site‑a"
pdm-cli ceph enable --remote site-a

Verificación

  1. Conexión remota – En la UI de PDM, el nodo debe aparecer con estado Connected y versión de Proxmox VE.
  2. Instalación automática – Arrancar el servidor con la opción pdm-token=... en la línea de arranque; el instalador debe descargar el answer file y completarse sin intervención.
  3. Suscripción registrada – Después del primer arranque, ejecutar pveversion -v dentro del nodo; la salida debe incluir la línea subscription: active.
  4. Panel Ceph – Acceder a Monitoring → Ceph y confirmar que todos los OSD, MON y pools aparecen con valores de salud HEALTH_OK.
  5. Guest view – En Cross‑Remote Guests, buscar una VM recién creada y probar la acción Resume; la VM debe volver a estar en estado running.

Notas adicionales

  • Sincronización horaria: todos los nodos y PDM deben usar NTP; los tokens de seguridad dependen de la hora correcta.
  • Firewall: abre los puertos 8006 (UI) y 22 (SSH) entre PDM y los remotos; el tráfico de Ceph usa 6789/6800‑7300.
  • Respaldo de configuración: PDM almacena answer files y suscripciones en /etc/pdm/; incluye esta ruta en tu política de backup.
  • Rotación de tokens: programa una tarea cron que regenere los tokens cada 30 días para evitar expiraciones inesperadas.
  • Escalado: si la carga de PDM supera los recursos de una sola máquina, considera desplegarlo en alta disponibilidad usando dos nodos con un balanceador de carga frontal.