La sentinelle pour Proxmox : Atlas Watch
La surveillance sur Proxmox devient généralement un projet en soi : installer Grafana, alimenter InfluxDB, construire les tableaux de bord à la main. Le résultat a fière allure, mais son maintien devient un travail à part entière. Atlas Watch prend une voie différente : la surveillance est intégrée au cockpit déjà en place. Les contrôles s'exécutent d'eux-mêmes et signalent ce qui ne va pas, sans aucune pile séparée à configurer.
Pourquoi une pile de surveillance séparée n'est pas toujours souhaitable
La chaîne Grafana + InfluxDB + exporteur est puissante, mais la mettre en place, la mettre à jour et entretenir les tableaux de bord représente une charge à part entière. Dans un homelab, la plupart des gens la configurent une fois, puis elle devient obsolète.
Quand la surveillance vit dans un onglet séparé, il faut changer d'outil entre voir un problème et le corriger. L'alerte est à un endroit, la correction à un autre.
Le pire, c'est une panne silencieuse : une sauvegarde échoue pendant la nuit, un pool se remplit, un service entre dans une boucle de redémarrage. Comme personne ne surveille, cela n'apparaît pas au grand jour mais seulement une fois qu'il est trop tard.
Ce que fait Atlas Watch
Il garde un doigt sur le pouls de l'hôte et remonte ce qui compte :
Contrôles de santé planifiés
Un catalogue de contrôles prêt à l'emploi s'exécute à intervalles définis : santé des disques, état des pools, services, capacité et plus, sans configuration préalable.
E-mail instantané sur les constats critiques
Quand un contrôle devient critique, un e-mail arrive sans délai, avec un temps de repos intelligent pour éviter les répétitions envahissantes.
Centre de notifications
Chaque constat se rassemble en un seul endroit ; chaque alerte montre où elle se situe sur une véritable mini-topologie, pas une ligne abstraite.
Résumé quotidien
Les éléments non critiques s'accumulent en un résumé : pas d'e-mail pour chaque petite chose, l'image du jour en un seul coup d'œil.
Livraison flexible
L'e-mail peut être envoyé localement en direct, ou passer par un serveur SMTP interne ; le meilleur chemin est choisi selon la configuration.
Des règles sur mesure
Au-delà du catalogue prêt à l'emploi, des seuils et des règles peuvent être définis ; Watch surveille ce qui lui a été confié.
Questions fréquentes
- Dois-je installer Grafana ou InfluxDB pour Atlas Watch ?
- Non. Watch est intégré à Atlas ; aucune pile de surveillance séparée n'est à configurer. Les contrôles et les alertes fonctionnent dès la sortie de la boîte.
- Comment les alertes me parviennent-elles ?
- Les constats critiques arrivent par e-mail immédiatement ; les non critiques s'accumulent en un résumé quotidien. L'e-mail peut être envoyé localement ou passer par un serveur SMTP interne. Les notifications se rassemblent aussi dans le centre de notifications du panneau.
- Fonctionne-t-il sans internet ?
- Oui. Watch s'exécute localement sur l'hôte ; tant qu'il peut envoyer des e-mails localement ou via un SMTP interne, il n'a pas besoin d'internet.
- La même alerte va-t-elle me bombarder toute la journée ?
- Non. Les alertes critiques ont un temps de repos intelligent ; le même constat ne produit pas le même e-mail encore et encore. Les répétitions restent visibles, mais la boîte de réception ne se remplit pas.
- Puis-je choisir ce qu'il surveille ?
- Oui. Aux côtés du catalogue de contrôles prêt à l'emploi, des seuils et des règles peuvent être définis ; le caractère critique de chaque constat se décide ainsi, le reste va dans le résumé.
- Watch remplace-t-il un outil de surveillance comme Pulse ?
- Des tâches différentes. Les outils de surveillance se spécialisent dans les tableaux de bord ; Watch est la sentinelle du cockpit déjà en place : il se place à côté des mises à jour, du stockage et de l'accès dans le même produit. Si la surveillance est la tâche principale, un outil dédié a du sens ; pour gérer l'hôte depuis un seul endroit, Watch est déjà là.
Fiches liées
- La tâche de sauvegarde s’est arrêtée en silence : la panne la plus chère n’est pas la bruyante Une sauvegarde qui échoue bruyamment est réparée le jour même. Une sauvegarde qui s’arrête en silence est découverte le jour où elle servait. La différence n’est pas dans une notification, elle est dans ce que vous regardez.
- Que devrait vous dire le premier écran d'un serveur Proxmox ? La plupart des écrans de vue d'ensemble répondent à « qu'est-ce qui existe ». La question utile est « quelque chose ne va pas, et cela demande-t-il mon attention aujourd'hui ». Ce sont deux écrans différents, et un seul mérite d'être ouvert chaque matin.
- Avez-vous besoin d'une pile de métriques, ou la vue intégrée répond-elle déjà à votre question ? Alertes et métriques sont deux outils pour deux questions différentes. La vue intégrée répond très bien à « est-ce cassé maintenant ». Une pile de métriques répond à « que se passait-il mardi dernier à trois heures », et c'est la seule raison d'en faire tourner une.
- Il s'est passé quelque chose cette nuit : où se trouve vraiment la trace Une alerte dit que quelque chose est arrivé. Un journal dit pourquoi. Le piège : la trace dont vous avez le plus besoin couvre la minute où la machine est morte, et sur une installation par défaut c'est justement celle qui a le plus de chances de manquer.