Problema

En entornos con Windows Server 2025 recién desplegados aparecen varios síntomas que indican una falta de madurez del sistema operativo. Los fallos más habituales son:

  • Instalaciones automáticas que abortan al usar autounattend.xml con configuraciones de particionado.
  • Pérdida intermitente de confianza de dominio entre clientes Windows 10/11 y controladores de dominio (DC) 2025.
  • El RDS Connection Broker deja de responder después de reinicios por Patch Tuesday.
  • Fallos de NVIDIA vGPU en sesiones RDS: la reconexión bloquea el host.
  • Actualizaciones de Windows Update extremadamente lentas y reinicios que tardan minutos.
  • El servicio de WSUS Reporting se detiene sin razón aparente.
  • Replicación de AD y tráfico de DNS se interrumpe, requiriendo reinicios de los DC.

Estos problemas no aparecen sólo en una instalación concreta; se repiten en VMs recién creadas, tanto en Hyper‑V como en otras plataformas de virtualización. El patrón es: una versión “fresh” de Server 2025 que, bajo carga real, muestra inestabilidad en componentes críticos (AD, RDS, vGPU, WSUS).

Causa

Varias causas subyacentes suelen combinarse:

  1. Controladores de almacenamiento y particionado
    La herramienta de particionado integrada en la fase de OOBE todavía tiene bugs que impiden que el script de diskpart generado por autounattend.xml se ejecute correctamente. El problema se manifiesta cuando se intenta crear particiones dinámicas o usar discos GPT con configuraciones no estándar.

  2. Sincronización de tiempo y Kerberos
    Windows Server 2025 introduce cambios en la gestión de NTP y en la tolerancia de clock skew para Kerberos. Si los DC dependen de fuentes externas (firewalls, appliances) y no se alinean con la nueva lógica, los tickets de autenticación expiran y los clientes pierden la confianza del dominio.

  3. Servicios críticos de RDS
    El Connection Broker y el Remote Desktop Licensing dependen de la base de datos de AD y de la correcta replicación de objetos de servicio. Cuando la replicación falla, el broker no puede localizar los Session Hosts y deja de responder.

  4. Controladores de GPU y capas de virtualización
    El stack de NVIDIA vGPU todavía está en fase de certificación para Server 2025. Cambios en la API de Hyper‑V y en la gestión de dispositivos PCI‑Passthrough provocan deadlocks al intentar reusar una sesión con vGPU.

  5. Windows Update y WSUS
    La nueva arquitectura de Windows Update (basada en Delivery Optimization 2.0) tiene problemas de rendimiento cuando la red está segmentada por VLANs de gestión. Además, el servicio de WSUS Reporting depende de un WMI provider que se reinicia inesperadamente bajo alta carga.

  6. Configuraciones por defecto
    Algunas políticas de seguridad (por ejemplo, Secure Boot y Device Guard) están habilitadas por defecto y pueden bloquear scripts de diskpart o impedir que los controladores de GPU se carguen en entornos de VM.

Solución

Una estrategia de mitigación dividida en tres capas suele ser suficiente para estabilizar un despliegue de Server 2025.

1. Instalación fiable

  • Evita confiar exclusivamente en la sección de diskpart dentro de autounattend.xml.
  • Genera un script de diskpart independiente y ejecútalo desde setupcomplete.cmd o desde una first‑boot task.
  • Usa discos VHDX con formato GPT y crea la partición del sistema con los parámetros recomendados por Microsoft (200 MiB EFI, 128 MiB MSR, resto como Primary).

2. Sincronización de tiempo y Kerberos

  • Configura los DC para que actúen como fuentes NTP internas y desactiva la dependencia de firewalls externos:
w32tm /config /manualpeerlist:"ntp1.local,0x1 ntp2.local,0x1" /syncfromflags:MANUAL /reliable:yes /update
net stop w32time && net start w32time
w32tm /resync /rediscover
  • Aumenta la tolerancia de clock skew mediante la política de dominio:
reg add "HKLM\System\CurrentControlSet\Services\Kdc\Parameters" /v MaxClockSkew /t REG_DWORD /d 900 /f
  • Verifica que los controladores de dominio tengan la misma zona horaria y que el servicio de Windows Time esté en modo NTP.

3. RDS y vGPU

  • Separa los roles: dedica un DC exclusivamente a ADDS y otro a servicios de infraestructura (DNS, DHCP).
  • Habilita la replicación de AD con Site Links de 5 minutos y monitoriza con repadmin /showrepl.
  • Para el Connection Broker, habilita el registro de eventos de nivel Verbose (clave de registro HKLM\Software\Microsoft\Windows NT\CurrentVersion\Terminal Services\Connection Broker).
  • En entornos con NVIDIA vGPU, instala la versión de driver certificada para Server 2025 (si está disponible) o, como medida provisional, desactiva el vGPU en los Session Hosts y usa GPU física para pruebas.
  • Añade la siguiente línea a C:\Windows\System32\drivers\etc\hosts en los hosts RDS para evitar resolución DNS inversa que a veces bloquea el broker:
10.0.0.10   rds-broker.local

4. Windows Update y WSUS

  • Limita la descarga de actualizaciones a través de Delivery Optimization a la subred de gestión:
reg add "HKLM\Software\Policies\Microsoft\Windows\DeliveryOptimization\Parameters" /v DODownloadMode /t REG_DWORD /d 0 /f
  • Reinicia automáticamente el servicio WSUS Reporting con una tarea programada que verifique su estado cada 30 min:
schtasks /create /sc minute /mo 30 /tn "WSUSReportRestart" /tr "net stop wsusreport && net start wsusreport"
  • Configura la política de reinicio automático de actualizaciones solo en servidores de infraestructura crítica:
reg add "HKLM\Software\Policies\Microsoft\Windows\WindowsUpdate\AU" /v NoAutoRebootWithLoggedOnUsers /t REG_DWORD /d 1 /f

5. Monitoreo y alerta temprana

  • Implementa un heartbeat de AD con repadmin /showrepl y alerta cuando la latencia supere 2 minutos.
  • Usa Performance Monitor para rastrear los contadores System\Processor Queue Length y Hyper-V Virtual Machine\Hypervisor Root Virtual Processor\% Total Run Time; valores elevados indican que los reinicios están tardando demasiado.
  • Configura alertas de eventos 5719 (Kerberos) y 1008 (WSUS Reporting) en el SIEM.

Cuándo aplicar esta solución

Aplica este conjunto de pasos cuando:

  • Los servidores son VMs recién creadas con Windows Server 2025 (no actualizaciones in‑place).
  • Aparecen fallos intermitentes de dominio, RDS o vGPU sin un patrón claro.
  • Windows Update muestra tiempos de descarga superiores a 30 min por parche.
  • Los servicios críticos (WSUS Reporting, Connection Broker) se detienen sin registro de error evidente.

No es necesario aplicar todas las capas si sólo experimentas un problema aislado (por ejemplo, solo la instalación). En ese caso, concéntrate en la capa correspondiente (instalación fiable o sincronización de tiempo).

Código

:: Script de particionado para autounattend (ejecutado en first‑boot)
diskpart /s create_partitions.txt

:: create_partitions.txt
select disk 0
clean
convert gpt
create partition efi size=200
format quick fs=fat32 label="System"
assign letter=S
create partition msr size=128
create partition primary
format quick fs=ntfs label="Windows"
assign letter=W
exit
:: Registro para aumentar tolerancia de Kerberos (MaxClockSkew = 15 min)
reg add "HKLM\System\CurrentControlSet\Services\Kdc\Parameters" /v MaxClockSkew /t REG_DWORD /d 900 /f
:: Desactivar Delivery Optimization para evitar cuellos de botella de red
reg add "HKLM\Software\Policies\Microsoft\Windows\DeliveryOptimization\Parameters" /v DODownloadMode /t REG_DWORD /d 0 /f

Verificación

  1. Instalación – Después del reinicio, verifica que la partición C: tenga el tamaño esperado y que diskpart /list volume muestre la partición EFI y MSR sin errores.
  2. Sincronización – Ejecuta w32tm /query /status en todos los DC; el Stratum debe ser 2 o menos y la diferencia de tiempo < 3 s.
  3. RDS Broker – Abre el Event Viewer en el broker y busca eventos 1008 o 5719. La ausencia de errores después de un reinicio indica estabilidad.
  4. vGPU – Inicia una sesión RDS con vGPU y verifica que la reconexión no genere pantalla negra ni cuelgue el proceso rdpclip.exe.
  5. WSUS – En la consola de WSUS, confirma que el informe de estado se actualiza cada 30 minutos y que no aparecen errores 0x8007000d.
  6. Windows Update – Mide el tiempo de descarga de un parche grande (ej. KB5006670). Debe completarse en menos de 10 min en una red de 1 Gbps.

Notas adicionales

  • Mantén una copia de los scripts de diskpart y de las claves de registro en un repositorio Git interno; cualquier cambio futuro en la versión de Server 2025 puede requerir ajustes menores.
  • Cuando uses NVIDIA vGPU, revisa el Release Notes de cada driver; la compatibilidad con Server 2025 suele añadirse en versiones posteriores a la GA.
  • Si la replicación de AD sigue fallando después de aplicar los ajustes de tiempo, considera habilitar el KCC manualmente con repadmin /kcc.
  • En entornos con alta rotación de VMs, automatiza el reinicio del servicio WSUS Reporting mediante una tarea programada como se muestra; esto evita que una única caída