Añadir y quitar un nodo en un clúster: los pasos sin vuelta atrás

Unirse a un clúster no es que te añadan a una lista. La configuración de la máquina que se une queda sustituida por la del clúster, y quitar va en un solo sentido.

AtlasPVE ·

Esta entrada responde a

  • proxmox añadir nodo al clúster
  • proxmox quitar nodo
  • proxmox error al unir al clúster
  • proxmox volver a añadir un nodo quitado
  • proxmox reducir clúster

Añadir una máquina a un clúster parece un par de clics en el panel. En segundo plano, sin embargo, significa que una máquina cede su identidad. Y algunos pasos no tienen vuelta atrás.

La máquina que se une debe estar vacía

Unirse a un clúster no es apuntar tu nombre en una lista. La configuración de clúster de la máquina que se une queda sustituida por la del clúster.

Consecuencia práctica: un servidor con máquinas encima no puede unirse al clúster conservándolas. La unión espera que la configuración de invitados del lado que se une esté vacía.

La regla es clara: únete con un nodo vacío. Si hay trabajo encima, muévelo antes. La forma de moverlo es hacer una copia y restaurarla tras unirse. No te unas esperando; si la operación se queda a medias no te queda ni el estado viejo ni el nuevo.

Quitar va en un solo sentido

Aquí hace falta cuidado de verdad. Cuando quitas un nodo de un clúster, no puedes traerlo de vuelta con el mismo nombre y la misma identidad.

El motivo: el clúster que queda sigue llevando la identidad del nodo quitado en su propio estado. Una máquina que vuelve con la misma identidad crea una contradicción entre lo que el clúster ve y lo que es real.

Si quieres reutilizar la máquina quitada solo hay un camino: instálala desde cero. No es un consejo de comodidad, es la única vía segura.

La máquina se apaga antes de quitarla

Segunda regla: el nodo que se va a quitar se apaga y sigue apagado. Intentar quitar un nodo encendido hace que ese nodo vuelva y desordene el clúster.

El orden es: mueve el trabajo, apaga la máquina, después quítala del clúster.

El efecto secundario oculto de quitar: cambia la mayoría

Esto es lo que nadie cuenta. Cuando quitas un nodo, también tiene que cambiar el número de votos que el clúster espera.

Si quitas un nodo de un clúster de tres, quedan dos, y dos nodos son exactamente el estado frágil: si cae uno, el único nodo que queda no puede hacer mayoría y el clúster se bloquea.

Así que la operación "estoy jubilando un nodo" puede llevarte, sin que lo notes, a la peor disposición. Al decidir reducir, piensa desde el principio si vas a bajar a tres.

Los nombres se eligen en la instalación

Detalle pequeño pero molesto: los nombres de nodo no se cambian fácilmente una vez dentro de un clúster. El nombre que des en la instalación se quedará contigo mucho tiempo.

Tómate un minuto y elige un nombre con sentido. Tres nodos llamados "pve" hacen difícil, seis meses después, saber qué máquina estás mirando.

El orden para reducir

El orden a seguir al reducir un clúster: mueve el trabajo a otros nodos, apaga la máquina, quítala del clúster, comprueba que los nodos restantes siguen teniendo mayoría, y si vas a reutilizar esa máquina, instálala desde cero.

El cuarto paso es el que más se salta, y cuando se salta el problema no se ve enseguida: todo sigue funcionando, hasta que cae un nodo.

Qué hace Atlas

Digamos primero el límite con claridad: Atlas no realiza el añadido ni la retirada de nodos. Eso es cosa del clúster y debe seguir siéndolo.

Lo que Atlas hace es hacer visible el efecto de esas operaciones. Al leer el estado del clúster no dice solo "hay un clúster"; muestra por separado cuántos votos se han reunido y cuántos se esperan.

El valor de esa distinción aparece justo en este artículo. Tras quitar un nodo puedes ver si el número de votos esperados bajó de verdad. Si el clúster sigue esperando un nodo que ya no existe, lo dice la diferencia entre votos reunidos y votos esperados, y eso hay que notarlo antes de que caiga otro nodo.

La misma información se usa en el lado del mantenimiento: antes de actualizar un nodo se calcula si la mayoría se mantiene en ese momento. Empezar un mantenimiento en un clúster bloqueado no hace más que agrandar el problema.

Fuentes

La documentación oficial de Proxmox. En inglés, y en este asunto es ella la que tiene la última palabra.

Entradas relacionadas

¿Cómo se ve esto dentro de Atlas?

Ir a la página del producto