El calor: la avería que no rompe nada pero lo acorta todo

Un servidor que se calienta demasiado no se cae. Se ralentiza y envejece más rápido. Como nunca da error, pasa desapercibido durante años.

AtlasPVE ·

Esta entrada responde a

  • proxmox temperatura de discos
  • proxmox servidor se calienta
  • proxmox monitorizar temperatura cpu
  • se puede tener un servidor en un armario
  • proxmox ruido de ventiladores

Un servidor que se calienta demasiado no se cae. Se ralentiza y envejece más rápido. Como no da error en ninguna parte, pasa desapercibido durante meses, a veces años.

Tres efectos, por orden de sigilo

La ralentización. Los procesadores bajan su velocidad para protegerse. Nada da error; la máquina simplemente va lenta. Y va lenta justo cuando está trabajando duro, es decir, cuando menos se nota: "hay carga, claro que va lenta", y a otra cosa.

El envejecimiento. Bajo calor continuo, la vida esperada de cada pieza baja. Hoy no lo ves. Lo ves dos años después, como una avería que llegó antes de lo que debía.

La avería simultánea. Esto es lo que importa y nadie lo dice. El calor afecta a todo lo que hay dentro de la caja al mismo tiempo. Discos comprados juntos, que funcionan juntos y se calientan juntos, mueren juntos.

Ese es exactamente el escenario del que tu disposición de discos no te protege. Cuando muere un disco empieza la reparación, la reparación fuerza a los discos que quedan, y esos discos ya han vivido el mismo tiempo a la misma temperatura.

De dónde viene el calor en un servidor pequeño

Normalmente no del procesador. Un armario cerrado, un filtro con polvo, discos apilados uno encima de otro sin hueco de aire, y el caso más común: la máquina puesta en un sitio sin aire.

Y el motivo siempre es el mismo: el ruido.

El intercambio que nadie planifica

Va así. La máquina hace ruido, molesta. Se traslada a un armario o a un trastero. El problema del ruido queda resuelto.

Seis meses después los discos funcionan diez grados más calientes y nadie relaciona los dos hechos. Porque entre ellos pasó mucho tiempo y en medio no apareció ningún aviso.

El día que muevas la máquina, mira si el sitio al que la llevas recibe aire. Después no tendrás motivo para mirar.

El número a medir no es el pico sino el valor sostenido

Que la temperatura suba un rato durante una copia es normal. Un pico momentáneo no te dice nada.

Lo que importa es el valor en el que se queda durante horas. Un sistema que pasa el día entero a la misma temperatura alta se desgasta mucho más que uno que hace un pico breve.

Y un consejo práctico: no mires la temperatura de un solo disco, mira la diferencia entre discos. Si un disco está siempre más caliente que sus vecinos, eso no es un problema de disco sino de colocación. Mover ese disco sale más barato que comprar uno nuevo.

Qué hace Atlas

Atlas muestra la temperatura de las últimas veinticuatro horas de cada disco junto a sus velocidades de lectura y escritura. Así respondes no a "cuántos grados ahora" sino a "dónde estuvo a lo largo del día"; que es justo la prueba de arriba.

Un detalle de diseño merece decirse, porque toca una trampa en la que las herramientas de monitorización caen a menudo: estas medidas solo se piden cuando abres la ficha de ese disco. Para los discos que quedan cerrados en la lista no sale ninguna consulta.

El motivo es simple y es un principio general: un panel de monitorización que consulta todo continuamente se convierte él mismo en una fuente de carga. Lo que observa no debe ser lo que cuesta.

Fuentes

La documentación oficial de Proxmox. En inglés, y en este asunto es ella la que tiene la última palabra.

Entradas relacionadas

¿Cómo se ve esto dentro de Atlas?

Ir a la página del producto