Ik zette hoge beschikbaarheid aan en de machine stond toch stil: wat HA werkelijk belooft

HA belooft geen ononderbroken werking maar een automatische herstart. Het verschil is een paar minuten, en een verwachting die die minuten niet kent, eindigt in teleurstelling.

AtlasPVE ·

Dit artikel beantwoordt

  • wat is proxmox ha
  • proxmox hoge beschikbaarheid instellen
  • proxmox ha werkt niet
  • wat is proxmox fencing
  • proxmox knooppunt uitgevallen vm niet verplaatst

Je zette hoge beschikbaarheid aan. Een knooppunt viel weg en je machine kwam werkelijk op het andere knooppunt omhoog. Maar tussendoor leverde hij een paar minuten niets, en jij dacht dat er geen onderbreking zou zijn.

Daar zit het misverstand: hoge beschikbaarheid belooft geen ononderbroken werking maar een automatische herstart.

Twee verschillende dingen

Verplaatsen tijdens het draaien is gepland werk. Jij zet het in gang, de machine gaat samen met haar werkgeheugen naar het andere knooppunt en staat nauwelijks stil. Dit is het gereedschap van onderhoudsnachten.

Hoge beschikbaarheid is er voor een ongeplande storing. Stort een knooppunt in, dan is alles wat in zijn werkgeheugen zat met hem meegegaan; er valt niets meer te kopiëren. Het enige wat kan, is de machine op een ander knooppunt vanaf nul starten. Ze komt dus omhoog zoals je server na een stroomstoring omhoog komt.

Daarom zou de maat voor HA niet "was er een onderbreking" moeten zijn maar "hoe lang duurde de onderbreking".

Drie dingen bepalen de duur

Het opmerken. Het cluster besluit niet meteen dat een knooppunt echt dood is. Een schommeling in het netwerk voor een dood aanzien en de machines verplaatsen is erger dan de dood niet opmerken. Daarom is er een wachttijd.

Het stilleggen van het oude knooppunt. Deze stap wordt het vaakst verkeerd begrepen en is het hart van dit artikel: voordat de machine op het nieuwe knooppunt omhoog komt, moet zeker zijn dat het oude werkelijk stilstaat. Kan dat niet worden vastgesteld, dan start het cluster dat knooppunt met kracht opnieuw op.

Het klinkt hard, maar het alternatief is een ramp: staat het oude knooppunt in werkelijkheid overeind en is alleen zijn netwerk weggevallen, dan draait dezelfde machine op twee plekken en schrijft van twee kanten naar dezelfde schijf. De gegevens raken onherstelbaar beschadigd. Daarom sluit het cluster liever een knooppunt af waarover het onzeker is.

Het opstarten. De machine start op het nieuwe knooppunt vanaf het begin. Het besturingssysteem komt op, diensten starten, een gegevensbank herstelt zichzelf als die er is. Deze tijd is de gewone opstarttijd van je machine; het cluster kan hem niet verkorten.

Het totaal ligt in de meeste opstellingen in de orde van minuten. Het is geen nul, en dat wordt het niet.

Drie voorwaarden waaronder HA werkt

Een meerderheid. HA hangt ervan af of het cluster kan beslissen. Zonder meerderheid verplaatst er niets. HA aanzetten in een cluster van twee knooppunten is een vangnet bouwen dat het begeeft op precies het moment dat je het het hardst nodig hebt.

De schijf zichtbaar vanaf het andere knooppunt. Zal de machine op het nieuwe knooppunt omhoog komen, dan moet ze bij haar schijf kunnen. Een machine die alleen op lokale opslag staat, kan nergens heen.

Capaciteit. De overgebleven knooppunten moeten ook de last van het weggevallen knooppunt kunnen dragen. Zijn beide knooppunten voor tachtig procent vol, dan redt HA je niet, hij haalt het tweede knooppunt er ook bij onderuit.

Zet HA niet voor elke machine aan

Elke machine met HA aan wordt iets wat het cluster onafgebroken in de gaten houdt en naar eigen inzicht start of stopt. Dat is niet altijd wat je wilt.

De toets is eenvoudig: als deze machine om drie uur 's nachts vanzelf op een ander knooppunt omhoog kwam, zou ik daar 's ochtends gerust of ongerust van worden? Word je gerust, zet HA aan. Word je ongerust, doe het niet; neem de beslissingen voor die machine zelf.

Wat Atlas doet

Atlas markeert apart de machines die aan het hoge-beschikbaarheidsbeheer zijn overgelaten. Waar dit het meest helpt is onderhoud: worden de machines op een knooppunt vóór een update opgesomd, dan is los zichtbaar welke van jouw beslissing en welke van die van het cluster afhangen. Met de hand verplaatsen en aan het beheer overlaten zijn verschillende dingen, en ze verwarren is duur.

Een klein maar betekenisvol gedrag: is op de installatie nooit hoge beschikbaarheid ingesteld, dan ziet Atlas dat de bijbehorende instellingenbestanden ontbreken en stelt die vraag helemaal niet, het geeft een leeg antwoord terug. Op een opstelling zonder HA houdt het product jou en het systeem dus niet bezig met zoeken naar iets wat er niet is.

En één grens verdient het duidelijk gezegd te worden: Atlas neemt noch verandert de HA-beslissing van het cluster. Of een machine aan HA wordt overgelaten is jouw zaak en die van Proxmox; Atlas maakt het zichtbaar, het beslist niet voor jou.

Bronnen

De eigen documentatie van Proxmox. In het Engels, en die heeft over dit onderwerp het laatste woord.

Verwante artikelen

Hoe ziet dit eruit in Atlas?

Naar de productpagina