Wartownik dla Proxmoksa: Atlas Watch
Monitorowanie na Proxmoksie zwykle zamienia się w osobny projekt: instalacja Grafany, zasilenie InfluxDB, ręczne budowanie pulpitów. Wynik wygląda dobrze, ale jego utrzymanie też staje się osobną pracą. Atlas Watch idzie inną drogą: monitorowanie przychodzi wbudowane w już zarządzany kokpit. Kontrole idą same, a informacja o problemie przychodzi bez osobnego stosu do postawienia.
Dlaczego osobny stos monitorowania bywa zbędny
Łańcuch Grafana plus InfluxDB plus eksportery jest potężny, ale postawienie go, aktualizowanie i utrzymywanie pulpitów to osobne obciążenie. W domowym laboratorium większość osób stawia go raz, a potem on się starzeje.
Gdy monitorowanie mieszka w osobnej zakładce, między zobaczeniem problemu a jego naprawą trzeba przełączać narzędzia. Alert jest w jednym miejscu, naprawa w drugim.
Najgorsza jest cicha awaria: kopia zapasowa nie wykonuje się w nocy, pula się zapełnia, usługa wpada w pętlę restartów. Ponieważ nikt nie patrzy, wychodzi to na jaw nie za dnia, tylko gdy jest już za późno.
Co robi Atlas Watch
Trzyma rękę na pulsie hosta i przynosi ci to, co ważne:
Zaplanowane kontrole kondycji
Gotowy katalog kontroli działa w ustalonych odstępach (kondycja dysków, stan pul, usługi, pojemność i więcej), bez ręcznego konfigurowania.
Natychmiastowa wiadomość przy krytycznych znaleziskach
Gdy kontrola robi się krytyczna, wiadomość przychodzi bez zwłoki, z mądrym czasem karencji, żeby powtórzenia nie zalały skrzynki.
Centrum powiadomień
Każde znalezisko zbiera się w jednym miejscu; każdy alert pokazuje, gdzie leży, na prawdziwej mini topologii, a nie na abstrakcyjnej linii.
Dzienne podsumowanie
Rzeczy niekrytyczne zbierają się w podsumowanie: żadnej wiadomości o każdym drobiazgu, obraz dnia w jednym przebiegu.
Elastyczne dostarczanie
Pocztę można wysyłać lokalnie bezpośrednio albo wypuszczać przez własny SMTP; dla danej konfiguracji wybierana jest najlepsza droga.
Własne reguły
Poza gotowym katalogiem można definiować własne progi i reguły; Watch pilnuje tego, co zostało mu wskazane.
Częste pytania
- Czy muszę instalować Grafanę albo InfluxDB dla Atlas Watch?
- Nie. Watch przychodzi wbudowany w Atlasa; osobny stos monitorowania nie jest potrzebny. Kontrole i alerty działają od razu.
- Jak docierają do mnie alerty?
- Krytyczne znaleziska przychodzą pocztą natychmiast; niekrytyczne zbierają się jako dzienne podsumowanie. Pocztę można wysyłać lokalnie albo wypuszczać przez własny serwer SMTP. Powiadomienia zbierają się też w centrum powiadomień w panelu.
- Czy działa bez internetu?
- Tak. Watch działa lokalnie na hoście; dopóki może wysyłać pocztę lokalnie albo przez własny SMTP, internetu nie potrzebuje.
- Czy ten sam alert będzie mnie bombardował cały dzień?
- Nie. Alerty krytyczne mają mądry czas karencji; to samo znalezisko nie produkuje w kółko tej samej wiadomości. Powtórzenia nadal są widoczne, ale skrzynka się nie zapełnia.
- Czy mogę wybrać, czego pilnuje?
- Tak. Obok gotowego katalogu kontroli można definiować własne progi i reguły; to od nich zależy, które znalezisko jest krytyczne, a które trafia do podsumowania.
- Czy Watch zastępuje narzędzie monitorujące w rodzaju Pulse?
- To inne zadania. Narzędzia monitorujące specjalizują się w pulpitach; Watch jest wartownikiem zarządzanego kokpitu, siedzącym obok aktualizacji, pamięci masowej i dostępu w tym samym produkcie. Gdy monitorowanie jest głównym zajęciem, dedykowane narzędzie ma sens; gdy host ma być zarządzany z jednego miejsca, Watch już tam jest.
Powiązane wpisy
- Zadanie kopii zapasowej stanęło po cichu: najdroższa awaria nie jest tą głośną Kopia, która zawodzi głośno, zostaje naprawiona tego samego dnia. Kopia, która staje po cichu, zostaje odkryta w dniu, w którym była potrzebna. Różnica nie leży w powiadomieniu, tylko w tym, na co patrzysz.
- Co powinien mówić pierwszy ekran serwera Proxmox? Większość ekranów przeglądu odpowiada na pytanie "co jest". Przydatne pytanie brzmi "czy coś jest nie tak i czy wymaga mnie dzisiaj". To dwa różne ekrany, i tylko jeden warto otwierać każdego ranka.
- Czy potrzebujesz stosu metryk, czy wbudowany widok już odpowiada na twoje pytanie? Alerty i metryki to różne narzędzia do różnych pytań. Wbudowany widok świetnie odpowiada na pytanie "czy coś jest teraz zepsute". Stos metryk odpowiada na pytanie "co działo się w zeszły wtorek o trzeciej", i to jedyny powód, żeby go utrzymywać.
- W nocy coś się stało: gdzie naprawdę leży zapis Alert mówi, że coś się stało. Dziennik mówi dlaczego. Haczyk polega na tym, że zapis potrzebny najbardziej obejmuje minutę, w której maszyna umarła, a przy instalacji domyślnej to właśnie jego najczęściej brakuje.