Warmte: de storing die niets kapotmaakt maar alles verkort

Een server die te warm draait, valt niet uit. Hij wordt trager en veroudert sneller. Omdat hij nooit een fout meldt, blijft het jarenlang onopgemerkt.

AtlasPVE ·

Dit artikel beantwoordt

  • proxmox schijftemperatuur
  • proxmox server wordt heet
  • proxmox cpu temperatuur volgen
  • kan een server in een kast
  • proxmox ventilatorlawaai

Een server die te warm draait, valt niet uit. Hij wordt trager en veroudert sneller. Omdat hij nergens een fout meldt, blijft het maandenlang, soms jarenlang onopgemerkt.

Drie gevolgen, op volgorde van stilte

Trager worden. Processors verlagen hun snelheid om zichzelf te beschermen. Niets meldt een fout; de machine is gewoon traag. En hij is traag precies wanneer hij zwaar werkt, dus wanneer het het minst opvalt: "er staat belasting op, natuurlijk is hij traag", en verder gaan we.

Verouderen. Onder aanhoudende warmte daalt de verwachte levensduur van elk onderdeel. Dat zie je vandaag niet. Je ziet het twee jaar later, als een storing die eerder kwam dan hij hoorde.

Samen uitvallen. Dit is wat telt en niemand zegt het. Warmte raakt alles in de kast tegelijk. Schijven die samen gekocht zijn, samen draaien en samen warm worden, sterven samen.

Dat is precies het scenario waartegen je schijfordening je niet beschermt. Sterft er één schijf, dan begint het herstel, het herstel belast de overgebleven schijven, en die schijven hebben al even lang bij dezelfde temperatuur geleefd.

Waar warmte vandaan komt in een kleine server

Meestal niet van de processor. Een gesloten kast, een stoffig filter, schijven zonder luchtruimte op elkaar gestapeld, en het meest voorkomende: de machine is ergens neergezet zonder lucht.

En de reden is altijd dezelfde: lawaai.

De ruil die niemand plant

Het gaat zo. De machine maakt lawaai, hij stoort. Hij verhuist naar een kast of een bergruimte. Het geluidsprobleem is opgelost.

Een half jaar later draaien de schijven tien graden warmer en niemand legt het verband tussen die twee gebeurtenissen. Want er zat veel tijd tussen en er verscheen tussendoor geen waarschuwing.

Op de dag dat je de machine verplaatst, kijk of de plek waar je hem zet lucht krijgt. Later heb je geen aanleiding om te kijken.

Het getal om te meten is niet de piek maar de aanhoudende waarde

Dat de temperatuur tijdens een back-up even stijgt, is normaal. Een momentane piek zegt je niets.

Wat telt is de waarde waarop hij urenlang blijft staan. Een systeem dat de hele dag op dezelfde hoge temperatuur blijft, slijt veel harder dan een systeem met een korte piek.

En een praktische tip: kijk niet naar de temperatuur van één schijf, kijk naar het verschil tussen schijven. Staat één schijf voortdurend warmer dan zijn buren, dan is dat geen schijfprobleem maar een plaatsingsprobleem. Die schijf verplaatsen is goedkoper dan een nieuwe kopen.

Wat Atlas doet

Atlas toont van elke schijf de temperatuur van de laatste vierentwintig uur naast de lees- en schrijfsnelheden. Je beantwoordt dus niet "hoeveel graden nu" maar "waar stond hij de hele dag"; dat is precies de toets hierboven.

Eén ontwerpdetail verdient het gezegd te worden, want het raakt een val waar bewakingsgereedschap vaak in trapt: deze metingen worden alleen opgehaald wanneer je de kaart van die schijf opent. Voor schijven die dicht in de lijst staan, gaat er helemaal geen bevraging uit.

De reden is eenvoudig en een algemeen beginsel: een bewakingspaneel dat voortdurend alles bevraagt, wordt zelf een bron van belasting. Wat kijkt, hoort niet te zijn wat kost.

Bronnen

De eigen documentatie van Proxmox. In het Engels, en die heeft over dit onderwerp het laatste woord.

Verwante artikelen

Hoe ziet dit eruit in Atlas?

Naar de productpagina