Väktaren för Proxmox: Atlas Watch
Övervakning på Proxmox blir oftast ett eget projekt: installera Grafana, mata InfluxDB, bygga instrumentpanelerna för hand. Resultatet ser bra ut, men underhållet blir också ett eget arbete. Atlas Watch tar en annan väg: övervakning finns inbyggd i den cockpit som redan hanteras. Kontrollerna körs av sig själva, och beskedet kommer när något går fel. Ingen separat stack att sätta upp.
Varför en separat övervakningsstack sällan lönar sig
Kedjan Grafana + InfluxDB + exporter är kraftfull, men att sätta upp den, uppdatera den och underhålla instrumentpanelerna är en belastning i sig. I ett homelab sätter de flesta upp det en gång, sedan blir det inaktuellt.
När övervakningen ligger i en separat flik krävs ett verktygsbyte mellan att se ett problem och att åtgärda det. Larmet finns på ett ställe, åtgärden på ett annat.
Det värsta är ett tyst fel: en säkerhetskopia misslyckas under natten, en pool fylls, en tjänst hamnar i en omstartsloop. Och eftersom ingen bevakar det syns det inte i dagsljus utan först när det är för sent.
Vad Atlas Watch gör
Det håller ett finger på hostens puls och för fram det som betyder något:
Schemalagda hälsokontroller
En färdig katalog med kontroller körs med bestämda intervall: diskhälsa, poolstatus, tjänster, kapacitet med mera, utan att något behöver ställas in.
Omedelbar e-post vid kritiska fynd
När en kontroll blir kritisk kommer ett e-postmeddelande utan dröjsmål, med en smart nedkylningsperiod så att upprepningar inte tar över inkorgen.
Notiscenter
Varje fynd samlas på ett ställe; varje larm visar var det finns på en verklig mini-topologi, inte som en abstrakt rad.
Daglig sammanfattning
Icke-kritiska poster samlas i en sammanfattning: inget e-postmeddelande för varje litet detalj, dagens bild i ett svep.
Flexibel leverans
E-post kan skickas lokalt direkt, eller gå ut via en egen SMTP; den bästa vägen väljs för uppsättningen.
Egna regler
Utöver den färdiga katalogen definieras egna tröskelvärden och regler; Watch bevakar det som pekats ut.
Vanliga frågor
- Behöver jag installera Grafana eller InfluxDB för Atlas Watch?
- Nej. Watch finns inbyggt i Atlas; ingen separat övervakningsstack behöver sättas upp. Kontroller och larm fungerar direkt.
- Hur når larmen mig?
- Kritiska fynd kommer direkt via e-post; icke-kritiska samlas i en daglig sammanfattning. E-post kan skickas lokalt eller gå ut via en egen SMTP-server. Notiser samlas också i notiscentret i panelen.
- Fungerar det utan internet?
- Ja. Watch körs lokalt på hosten; så länge den kan skicka e-post lokalt eller via en egen SMTP behövs inget internet.
- Kommer samma larm att bombardera mig hela dagen?
- Nej. Kritiska larm har en smart nedkylningsperiod; samma fynd ger inte samma e-post om och om igen. Upprepningar syns fortfarande, men inkorgen fylls inte.
- Kan jag välja vad den bevakar?
- Ja. Utöver den färdiga kontrollkatalogen definieras egna tröskelvärden och regler; vilket fynd som är kritiskt och vilket som blir en sammanfattningspost avgörs lokalt.
- Ersätter Watch ett övervakningsverktyg som Pulse?
- Olika uppgifter. Övervakningsverktyg specialiserar sig på instrumentpaneler; Watch är väktaren för den cockpit som hanteras. Den sitter bredvid uppdateringar, lagring och åtkomst i samma produkt. Är övervakning huvuduppgiften är ett dedikerat verktyg vettigt; ska hosten hanteras från ett ställe finns Watch redan där.
Relaterade artiklar
- Kopieringsjobbet stannade tyst: det dyraste felet är inte det högljudda En kopiering som misslyckas högljutt lagas samma dag. En kopiering som stannar tyst upptäcks den dag den behövdes. Skillnaden ligger inte i en avisering, den ligger i vad du tittar på.
- Vad borde första skärmen på en Proxmox-server berätta för dig? De flesta översiktsskärmar svarar på "vad som finns". Den användbara frågan är "är något fel, och behöver det mig i dag". Det är två olika skärmar, och bara en är värd att öppna varje morgon.
- Behöver du en mätvärdesstack, eller svarar den inbyggda vyn redan på din fråga? Larm och mätvärden är olika verktyg för olika frågor. Den inbyggda vyn svarar utmärkt på "är något trasigt nu". En mätvärdesstack svarar på "vad hände i tisdags klockan tre", och det är det enda skälet att driva en.
- Något hände i natt: var anteckningen faktiskt finns Ett larm säger att något hände. En logg säger varför. Haken är att den anteckning du behöver mest täcker minuten då maskinen dog, och vid en standardinstallation är det just den som oftast saknas.