Czy potrzebujesz stosu metryk, czy wbudowany widok już odpowiada na twoje pytanie?

Alerty i metryki to różne narzędzia do różnych pytań. Wbudowany widok świetnie odpowiada na pytanie "czy coś jest teraz zepsute". Stos metryk odpowiada na pytanie "co działo się w zeszły wtorek o trzeciej", i to jedyny powód, żeby go utrzymywać.

AtlasPVE ·

Ten wpis odpowiada na

  • czy potrzebuję grafany do proxmox
  • proxmox prometheus konfiguracja
  • panel monitorowania proxmox
  • proxmox historia metryk
  • proxmox grafana

Niemal w każdym domowym laboratorium przychodzi moment, w którym ktoś stawia stos metryk, buduje ładne panele, a potem przestaje je otwierać. Zwykle czyta się to jako brak dyscypliny. Częściej jest to niedopasowanie: stos odpowiadał na pytanie, którego nikt nie zadawał.

Alerty i metryki wyglądają na ten sam temat, a nim nie są. Alerty odpowiadają na pytanie czy coś jest teraz zepsute. Metryki odpowiadają na pytanie co działo się wtedy. To, czego potrzebujesz, zależy wyłącznie od pytań, które naprawdę zadajesz.

Pytanie, które rozstrzyga

Nie "czy powinienem monitorować serwer", bo powinieneś. Zapytaj inaczej: jak daleko wstecz musi sięgnąć odpowiedź?

"Czy jest zepsute teraz?" Na to odpowiada wbudowany widok. Bieżące obciążenie, pamięć, zajętość dysku, które maszyny działają. Dokładanie stosu metryk do tego pytania dokłada usługę i nie odpowiada na nic nowego.

"Czy było wolno w zeszły wtorek około trzeciej nad ranem?" Tu potrzebna jest historia, a nic wbudowanego nie trzyma jej tak długo w takiej rozdzielczości. To uczciwy powód, żeby utrzymywać stos metryk, i powód dobry.

"Czy dysk skończy się przed wiosną?" Potrzebujesz linii trendu, czyli historii z arytmetyką na wierzchu. Też prawdziwy powód.

"Która z tych dwóch zmian przyspieszyła działanie?" Potrzebujesz "przed" i "po" na jednym obrazie. Prawdziwy powód.

Jeśli żadne z twoich prawdziwych pytań nie sięga dalej niż do wczoraj, stos metryk jest raczej hobby niż narzędziem. To w porządku, ale warto wiedzieć, które z dwóch budujesz.

Ile to kosztuje, uczciwie

Kolejna usługa do utrzymania przy życiu. Stos metryk leżący od trzech tygodni jest gorszy niż żaden, bo wierzysz, że masz historię, a jej nie ma.

Zwykle działa na tym, co obserwuje. To pułapka warta nazwania: gdy host ma złą noc, zapis tej nocy ginie razem z nim. Wykres, którego najbardziej potrzebujesz, jest dokładnie tym, który przestał być zapisywany w chwili, gdy zrobiło się ciekawie.

Miejsce rośnie po cichu. Drobnoziarniste metryki z garstki maszyn sumują się szybciej, niż ludzie zakładają, a wzrost jest niewidoczny, dopóki dysk się nie zapełni.

Panele się starzeją. Panel zbudowany pod zeszłoroczny problem zajmuje miejsce na ekranie długo po tym, jak problem został rozwiązany.

Dwa nawyki, dzięki którym to się opłaca

Postaw rejestrator gdzie indziej niż to, co rejestruje. Choćby mała maszyna w innym miejscu, choćby tania. Jeśli się nie da, wiedz przynajmniej, że twoja historia dzieli los hosta, i traktuj wykresy jako wygodę, a nie dowód.

Zdecyduj o okresie przechowywania przed rozdzielczością. Ludzie najpierw wybierają interwał zbierania, a koszt miejsca odkrywają później. Użyteczna kolejność jest odwrotna: zdecyduj, jak daleko wstecz musisz patrzeć, i dopiero wtedy wybierz rozdzielczość, która zmieści się w miejscu, jakie chcesz oddać. Trzydzieści sekund przez tydzień zwykle daje mniej niż pięć minut przez rok.

Co Proxmox daje już teraz

Więcej, niż się zakłada. Są wbudowane wykresy dla węzła i dla każdej maszyny: procesor, pamięć, sieć i dysk w kilku zakresach czasu, bez instalowania czegokolwiek. Dla pojedynczego hosta z garstką maszyn pokrywa to większość pytań typu "czy wczoraj było obciążone".

Jest też udokumentowany sposób wysyłania metryk do zewnętrznej bazy szeregów czasowych, i to wspierana droga, gdy zdecydujesz, że jej potrzebujesz. To ma znaczenie: wybór nie polega na sklecaniu czegoś samemu, tylko na wspieranym przekazaniu.

Czym ten tekst nie jest

Nie jest wystąpieniem przeciwko Grafanie. Jest naprawdę znakomita, a przy wielu hostach albo pytaniach o pojemność w długim horyzoncie nie ma dla niej zamiennika.

Nie twierdzi, że panele są bezużyteczne. Jeden panel, który otwierasz co tydzień, jest wart dziesięciu zbudowanych i zapomnianych.

Co Atlas robi, a czego nie

Atlas nie jest stosem metryk i nie próbuje nim być. Nie ma bazy szeregów czasowych, nie trzyma miesięcy drobnoziarnistej historii, a jeśli twoje pytanie brzmi "jak wyglądała sieć w zeszły wtorek o 03:14", to Atlas jest złym narzędziem, a Grafana właściwym.

Atlas odpowiada na drugie pytanie: czy jest tu coś, co potrzebuje mnie dzisiaj. Codzienne podsumowanie niesie nieplanowane restarty, zainstalowane ale nieuruchomione jądro, wiek najnowszej kopii zapasowej, presję dysku i pamięci, zatrzymane krytyczne maszyny. To odpowiedzi tak albo nie o teraźniejszości, nie trendy o przeszłości.

Jedyne miejsce, w którym te dwa światy się przecinają, to pojemność, i tam Atlas świadomie zostaje płytki: zgłasza presję teraz, zamiast rysować krzywą. Jeśli potrzebujesz krzywej, to jest stos metryk, i uczciwa rada brzmi: utrzymuj go.

Powód, żeby powiedzieć to wszystko wprost, jest ten sam, dla którego istnieje reszta tej wiki. Narzędziu, które mówi, czego nie robi, łatwiej uwierzyć w to, co robi.

Źródła

Własna dokumentacja Proxmoksa. Po angielsku i to ona ma ostatnie słowo w tej sprawie.

Powiązane wpisy

Jak to wygląda wewnątrz Atlasa?

Przejdź do strony produktu