Activé la alta disponibilidad y la máquina se paró igual: qué promete de verdad la HA
La HA no promete funcionamiento sin interrupción, promete un reinicio automático. La diferencia son unos minutos, y una expectativa construida sin conocerlos acaba en decepción.
AtlasPVE ·
Esta entrada responde a
- qué es proxmox ha
- proxmox alta disponibilidad configuración
- proxmox ha no funciona
- qué es proxmox fencing
- proxmox nodo caído vm no se movió
Activaste la alta disponibilidad. Cayó un nodo y tu máquina de verdad levantó en el otro nodo. Pero entre medias no sirvió nada durante unos minutos, y tú creías que no habría interrupción.
El malentendido está aquí: la alta disponibilidad no promete funcionamiento sin interrupción, promete un reinicio automático.
Dos cosas distintas
El traslado en marcha es un trabajo planificado. Tú lo lanzas, la máquina pasa al otro nodo junto con su memoria y casi no se detiene. Es la herramienta de las noches de mantenimiento.
La alta disponibilidad es para una avería no planificada. Cuando un nodo se derrumba, todo lo que había en su memoria se fue con él; no queda nada que copiar. Lo único que se puede hacer es arrancar la máquina desde cero en otro nodo. Es decir, levanta igual que levanta tu servidor tras un corte de luz.
Por eso la medida de la HA no debería ser "hubo interrupción" sino "cuánto duró la interrupción".
Tres cosas fijan la duración
Darse cuenta. El clúster no decide de inmediato que un nodo ha muerto de verdad. Confundir una oscilación de la red con una muerte y mover las máquinas es peor que no darse cuenta de la muerte. Por eso hay una espera.
Silenciar el nodo viejo. Este paso es el peor entendido y es el corazón de este artículo: antes de que la máquina levante en el nodo nuevo hay que estar seguros de que el viejo se paró de verdad. Si no se puede establecer, el clúster reinicia ese nodo a la fuerza.
Suena duro, pero la alternativa es un desastre: si el nodo viejo en realidad está en pie y solo se le cortó la red, la misma máquina corre en dos sitios y escribe en el mismo disco desde ambos lados. Los datos se estropean sin vuelta atrás. Por eso el clúster prefiere apagar un nodo del que no está seguro.
El arranque. La máquina arranca desde el principio en el nodo nuevo. El sistema operativo se levanta, los servicios suben, una base de datos si la hay se recupera. Este tiempo es el tiempo normal de arranque de tu máquina; el clúster no tiene forma de acortarlo.
El total, en la mayoría de instalaciones, se mide en minutos. No es cero, y no lo será.
Tres condiciones para que la HA funcione
Una mayoría. La HA depende de que el clúster pueda decidir. Sin mayoría no se mueve nada. Activar la HA en un clúster de dos nodos es montar una red de seguridad que falla justo cuando más la necesitas.
Que el disco se vea desde el otro nodo. Si la máquina va a levantar en el nodo nuevo, tiene que alcanzar su disco. Una máquina que solo está en almacenamiento local no puede ir a ninguna parte.
Capacidad. Los nodos que quedan deben poder cargar también con lo del nodo caído. Si ambos nodos están al ochenta por ciento, la HA no te salva, tira también el segundo.
No actives la HA en cada máquina
Toda máquina con la HA activada se convierte en algo que el clúster vigila continuamente y arranca o para por decisión propia cuando lo cree oportuno. Eso no siempre es lo que quieres.
La prueba es simple: si esta máquina levantara sola en otro nodo a las tres de la madrugada, enterarme por la mañana me tranquilizaría o me preocuparía? Si tranquiliza, activa la HA. Si preocupa, no lo hagas; toma tú las decisiones de esa máquina.
Qué hace Atlas
Atlas marca aparte las máquinas dejadas a la gestión de alta disponibilidad. Donde más ayuda es en el mantenimiento: cuando se listan las máquinas de un nodo antes de una actualización, se ve por separado cuáles dependen de tu decisión y cuáles de la del clúster. Mover a mano y dejar a la gestión son cosas distintas, y confundirlas sale caro.
Un comportamiento pequeño pero significativo: si en la instalación nunca se configuró la alta disponibilidad, Atlas ve que faltan los archivos de configuración correspondientes y no hace esa pregunta en absoluto, devuelve una respuesta vacía. En una instalación que no usa HA, el producto no os entretiene ni a ti ni al sistema buscando algo que no existe.
Y conviene decir un límite con claridad: Atlas no toma ni cambia la decisión de HA del clúster. Que una máquina se deje a la HA es asunto tuyo y de Proxmox; Atlas lo hace visible, no decide por ti.
Fuentes
La documentación oficial de Proxmox. En inglés, y en este asunto es ella la que tiene la última palabra.