Você precisa de uma pilha de métricas, ou a visão embutida já responde sua pergunta?
Alertas e métricas são ferramentas diferentes para perguntas diferentes. A visão embutida responde muito bem a "está quebrado agora". Uma pilha de métricas responde a "o que estava acontecendo terça passada às três", e essa é a única razão para rodar uma.
AtlasPVE ·
Este verbete responde a
- preciso de grafana para proxmox
- proxmox prometheus instalação
- painel de monitoramento proxmox
- proxmox histórico de métricas
- proxmox grafana
Em quase todo homelab existe um momento em que alguém monta uma pilha de métricas, constrói painéis bonitos, e depois para de abri-los. Isso costuma ser lido como falta de disciplina. Mais frequentemente é um desencontro: a pilha respondia a uma pergunta que ninguém fazia.
Alertas e métricas parecem o mesmo assunto e não são. Alertas respondem tem algo errado agora. Métricas respondem o que estava acontecendo então. De qual você precisa depende inteiramente das perguntas que realmente faz.
A pergunta que decide
Não "devo monitorar meu servidor", porque deve. Pergunte em vez disso: quão para trás a resposta precisa alcançar?
"Está quebrado agora?" A visão embutida responde. Carga atual, memória, uso de disco, quais convidados estão rodando. Acrescentar uma pilha de métricas para essa pergunta acrescenta um serviço e não responde nada novo.
"Estava lento terça passada por volta das três da manhã?" Agora você precisa de histórico, e nada embutido guarda isso naquela resolução por tanto tempo. Essa é a razão honesta para rodar uma pilha de métricas, e é boa.
"Vou ficar sem disco antes da primavera?" Você precisa de uma linha de tendência, ou seja, histórico com aritmética em cima. Também razão real.
"Qual dessas duas mudanças deixou mais rápido?" Você precisa do antes e do depois na mesma imagem. Razão real.
Se nenhuma das suas perguntas reais vai além de ontem, uma pilha de métricas é hobby e não ferramenta. Isso é ótimo, e vale saber qual das duas você está construindo.
O que custa, honestamente
Mais um serviço para manter vivo. Uma pilha de métricas parada há três semanas é pior que nenhuma, porque você acredita ter histórico e não tem.
Ela costuma rodar em cima do que observa. Essa é a armadilha que merece nome: quando o host passa uma noite ruim, o registro daquela noite morre junto. O gráfico que você mais quer é justamente o que parou de ser escrito no momento em que ficou interessante.
O armazenamento cresce em silêncio. Métricas finas de um punhado de convidados somam mais rápido do que se espera, e o crescimento é invisível até um disco encher.
Painéis envelhecem. Um quadro feito para um problema do ano passado ocupa tela muito depois de o problema ter sido resolvido.
Os dois hábitos que fazem valer a pena
Coloque o gravador em outro lugar que não o gravado. Mesmo uma máquina pequena em outro canto, mesmo barata. Se for impossível, ao menos saiba que seu histórico compartilha o destino do host, e trate os gráficos como conveniência e não como prova.
Decida a retenção antes da resolução. As pessoas escolhem primeiro o intervalo de coleta e descobrem o custo de espaço depois. A ordem útil é o inverso: decida quão para trás precisa olhar, e então escolha a resolução que cabe no espaço que aceita dar. Trinta segundos por uma semana costuma servir menos que cinco minutos por um ano.
O que o Proxmox já entrega
Mais do que se supõe. Existem gráficos embutidos por nó e por convidado cobrindo processador, memória, rede e disco em várias faixas de tempo, sem instalar nada. Para um host único com poucos convidados, isso cobre a maior parte das perguntas "estava carregado ontem".
Também há um jeito documentado de enviar métricas para um banco de séries temporais externo, e esse é o caminho suportado quando você decide que precisa de um. Isso importa: a escolha não é "improvisar algo", é uma passagem de bastão suportada.
O que este texto não é
Não é um argumento contra o Grafana. Ele é realmente excelente, e para múltiplos hosts ou perguntas de capacidade de longo prazo não há substituto.
Não é dizer que painéis são inúteis. Um painel que você abre toda semana vale dez que você construiu e esqueceu.
O que o Atlas faz, e o que não faz
O Atlas não é uma pilha de métricas e não tenta ser. Não tem banco de séries temporais, não guarda meses de histórico fino, e se sua pergunta é "como estava a rede terça passada às 03:14", o Atlas é a ferramenta errada e o Grafana é a certa.
O que o Atlas responde é a outra pergunta: tem algo aqui que precisa de mim hoje. O resumo diário carrega reinícios não planejados, um kernel instalado mas não iniciado, a idade do backup mais recente, pressão de disco e memória, e convidados críticos parados. São respostas de sim ou não sobre o presente, não tendências sobre o passado.
O único ponto em que os dois se sobrepõem é capacidade, e ali o Atlas fica deliberadamente raso: relata a pressão agora em vez de projetar uma curva. Se você precisa da curva, isso é uma pilha de métricas, e a recomendação honesta é rodar uma.
A razão de dizer tudo isso abertamente é a mesma pela qual o resto deste wiki existe. Numa ferramenta que diz o que não faz, é mais fácil confiar no que ela faz.
Fontes
A documentação oficial do Proxmox. Em inglês, e é ela que dá a palavra final neste assunto.