PDF

Monitorowanie Proxmox VE

Monitoruj klastry Proxmox VE, węzły, maszyny wirtualne, kontenery, magazyny danych oraz stan Ceph za pośrednictwem Proxmox REST API.

cephcluster monitoringcontainerslxcnode monitoringproxmoxproxmox veqemurest apistorage monitoringvirtual machinesvirtualization

NetCrunch zapewnia zintegrowane monitorowanie infrastruktury Proxmox Virtual Environment. Gromadzi dane dotyczące kondycji, stanu i wydajności z klastrów Proxmox, fizycznych węzłów Proxmox, maszyn wirtualnych QEMU oraz kontenerów LXC za pomocą Proxmox REST API.

Monitorowanie Proxmox zapewnia scentralizowany i hierarchiczny widok infrastruktury:

  • Stan klastra i kworum
  • Dostępność węzłów Proxmox i wykorzystanie zasobów
  • Wykorzystanie datastore i magazynów danych
  • Stan klastra Ceph
  • Wydajność maszyn wirtualnych i kontenerów
  • Metryki procesora, pamięci, dysku, sieci, swapu oraz pressure stall

NetCrunch może łączyć się bezpośrednio z pojedynczym węzłem Proxmox lub pobierać informacje z całego klastra Proxmox.

Wymagania

Monitorowanie Proxmox wymaga danych uwierzytelniających zapewniających dostęp tylko do odczytu do Proxmox VE API.

Obsługiwane metody uwierzytelniania:

  • API Token, zalecana metoda
  • Nazwa użytkownika i hasło

Użytkownik monitorowania wymaga przypisania roli PVEAuditor na poziomie głównym /.

Zapewnia to dostęp tylko do odczytu do wszystkich zasobów klastra i jest wymagane do uzyskania pełnego wglądu w klaster, węzły, magazyny danych, maszyny wirtualne i kontenery.

To wymaganie dotyczy wszystkich obsługiwanych typów użytkowników Proxmox:

  • Lokalni użytkownicy Proxmox, na przykład user@pve
  • Użytkownicy Linux PAM, na przykład user@pam
  • Użytkownicy LDAP lub Active Directory

Jeśli to możliwe, używaj API token. Jest bezpieczniejszy niż przechowywanie hasła interaktywnego użytkownika i łatwiej go zmienić bez zmiany danych logowania użytkownika.

Konfiguracja

NetCrunch zawiera wstępnie skonfigurowane automatyczne pakiety monitorowania dla Proxmox VE. Gdy monitor systemu operacyjnego węzła jest ustawiony na Proxmox VE, NetCrunch może automatycznie zastosować wymagane ustawienia monitorowania.

W przypadku nowych węzłów Proxmox VE może zostać wykryty automatycznie. Monitorowanie Proxmox VE można również włączyć ręcznie w ustawieniach monitorowania węzła.

Po podaniu prawidłowych danych uwierzytelniających Proxmox NetCrunch wykrywa klaster Proxmox i wyświetla monit o dodanie go do monitorowania.

Opcje monitorowania klastra

Utwórz węzły atlasu dla węzłów Proxmox
Automatycznie dodaje węzły klastra Proxmox do Network Atlas w celu monitorowania.

Opcje monitorowania węzła

Utwórz węzły dla systemów gości
Automatycznie dodaje systemy gości Proxmox do Network Atlas. Dotyczy to wyłącznie gości ze znanym adresem IP.

W przypadku maszyn wirtualnych QEMU Proxmox Guest Agent musi być uruchomiony, aby adres IP systemu gościa był dostępny dla NetCrunch.

Monitorowanie klastra

Monitorowanie klastra śledzi kondycję i dostępność całego klastra Proxmox.

NetCrunch automatycznie gromadzi metryki wykorzystania magazynów danych dla klastra Proxmox i monitoruje kluczowe warunki na poziomie klastra.

Alerty klastra

NetCrunch może generować alerty dotyczące następujących warunków klastra Proxmox:

  • Ceph Cluster Warning
  • Ceph Cluster Critical
  • Cluster has no Quorum
  • Low free space on Datastore
  • Any Proxmox node goes offline

Zakres monitorowania klastra

Monitorowanie klastra koncentruje się na stanie współdzielonej infrastruktury, w tym na:

  • Kworum klastra
  • Członkostwie węzłów
  • Wykorzystaniu datastore
  • Kondycji magazynów danych na poziomie klastra
  • Kondycji Ceph, jeśli środowisko Proxmox korzysta z Ceph

Monitorowanie węzła Proxmox

Węzeł Proxmox jest monitorowany przez włączenie na nim Proxmox VE OS monitor.

Monitorowanie węzła śledzi fizyczny lub wirtualny host z uruchomionym Proxmox VE. Gromadzi metryki na poziomie systemu i monitoruje obciążenie zasobów hosta.

Alerty węzła

NetCrunch może generować alerty dotyczące następujących warunków węzła Proxmox:

  • High CPU Usage
  • High memory usage
  • Low free disk space
  • High swap usage
  • Possible storage bottleneck, based on IO Wait
  • Node CPU Pressure Warning, when cpu > 70% or loadavg / maxcpu > 0.7
  • Node CPU Saturation Critical, when cpu > 90% and loadavg / maxcpu > 1.0

Metryki wydajności — węzeł Proxmox

Czujnik węzła Proxmox gromadzi kompleksowe metryki dotyczące wykorzystania zasobów i wydajności węzła.

Metryki procesora

  • Processor/% CPU Usage
  • Processor/CPU Count

Metryki pamięci

  • Memory/% Used
  • Memory/% Free
  • Memory/Total Bytes
  • Memory/Used Bytes
  • Memory/Free Bytes

Metryki dysku

  • Disk/% Used
  • Disk/% Free
  • Disk/Total Bytes
  • Disk/Used Bytes
  • Disk/Free Bytes

Metryki systemowe

  • System/Uptime
  • System/% IO Wait

Metryki obciążenia procesora

  • CPU Load/1 Minute Average
  • CPU Load/5 Minutes Average
  • CPU Load/15 Minutes Average

Metryki swapu

  • Swap/% Used
  • Swap/% Free
  • Swap/Total Bytes
  • Swap/Used Bytes
  • Swap/Free Bytes

Monitorowanie maszyn wirtualnych i kontenerów

Proxmox/VM Sensor jest dodawany automatycznie, gdy NetCrunch wykryje, że węzeł jest maszyną wirtualną lub kontenerem Proxmox.

Nie jest wymagana dodatkowa konfiguracja czujnika.

Obsługiwane typy systemów gości:

  • Maszyny wirtualne QEMU
  • Kontenery LXC

W przypadku maszyn wirtualnych QEMU Proxmox Guest Agent musi być zainstalowany i uruchomiony, jeśli chcesz, aby NetCrunch otrzymywał adres IP systemu gościa z Proxmox.

Alerty systemów gości

NetCrunch może generować alerty dotyczące następujących warunków systemów gości:

  • High guest processor utilization
  • High guest memory usage
  • Low free disk space on guest
  • CPU fully saturated, all tasks waiting
  • Applications waiting for CPU
  • Processes waiting for memory
  • System stalled due to memory pressure
  • Applications waiting for disk
  • All operations blocked by disk I/O

Metryki wydajności — maszyny wirtualne i kontenery

Czujnik Proxmox/VM Sensor gromadzi szczegółowe metryki dotyczące wykorzystania zasobów systemu gościa.

Metryki procesora systemu gościa

  • Guest Processor/% CPU Usage
  • Guest Processor/CPU Count

Metryki pamięci systemu gościa

  • Guest Memory/% Used
  • Guest Memory/% Free
  • Guest Memory/Total Bytes
  • Guest Memory/Used Bytes
  • Guest Memory/Free Bytes

Metryki swapu systemu gościa

Metryki swapu systemu gościa są dostępne wyłącznie dla kontenerów LXC.

  • Guest Swap/% Used
  • Guest Swap/% Free
  • Guest Swap/Total Bytes
  • Guest Swap/Used Bytes
  • Guest Swap/Free Bytes

Metryki dysku systemu gościa

  • Guest Proxmox.Guest.Disk/Read Bytes
  • Guest Proxmox.Guest.Disk/Write Bytes
  • Guest Proxmox.Guest.Disk/Read Bytes/sec
  • Guest Proxmox.Guest.Disk/Write Bytes/sec

Metryki sieci systemu gościa

  • Guest Network/In Bytes
  • Guest Network/Out Bytes
  • Guest Network/In Bytes/sec
  • Guest Network/Out Bytes/sec

Metryki Guest CPU Pressure Stall

  • Guest CPU Pressure Stall/% Some
  • Guest CPU Pressure Stall/% Full

Metryki Guest Memory Pressure Stall

  • Guest Memory Pressure Stall/% Some
  • Guest Memory Pressure Stall/% Full

Metryki Guest IO Pressure Stall

  • Guest IO Pressure Stall/% Some
  • Guest IO Pressure Stall/% Full

Metryki systemowe systemu gościa

  • Guest System/Process ID

Metryki Pressure Stall

Monitorowanie systemów gości Proxmox obejmuje metryki pressure stall, jeśli są dostępne.

Metryki pressure stall pomagają identyfikować rywalizację o zasoby, która może nie być widoczna wyłącznie na podstawie prostych wartości wykorzystania.

Obciążenie procesora
Pokazuje, jak długo zadania są opóźnione, ponieważ zasoby procesora są niedostępne.
Obciążenie pamięci
Pokazuje, jak długo procesy są opóźnione, ponieważ pamięć jest niedostępna lub aktywność odzyskiwania pamięci blokuje wykonywanie.
Obciążenie operacji wejścia/wyjścia
Pokazuje, jak długo zadania są blokowane przez operacje wejścia/wyjścia dysku lub magazynu danych.

Metryka % Some wskazuje, że co najmniej niektóre zadania oczekiwały na zasób.

Metryka % Full wskazuje, że wszystkie zadania inne niż bezczynne oczekiwały, co zwykle oznacza poważniejszy problem.

Zalecany przebieg konfiguracji monitorowania

Podczas dodawania monitorowania Proxmox VE użyj następującej sekwencji:

Dodaj lub wykryj węzeł Proxmox

Dodaj węzeł Proxmox do Network Atlas lub pozwól, aby NetCrunch wykrył go automatycznie.

Włącz monitorowanie Proxmox VE OS

Ustaw typ monitorowania systemu operacyjnego na Proxmox VE, jeśli nie został wykryty automatycznie.

Podaj dane uwierzytelniające Proxmox

Użyj API token lub nazwy użytkownika i hasła z przypisaną rolą PVEAuditor na poziomie /.

Dodaj wykryty klaster

Po zweryfikowaniu danych uwierzytelniających NetCrunch wykrywa klaster Proxmox i wyświetla monit o dodanie go do monitorowania.

Włącz automatyczne tworzenie węzłów

Użyj opcji Utwórz węzły atlasu dla węzłów Proxmox, aby automatycznie dodawać węzły klastra Proxmox.

Włącz wykrywanie systemów gości

Użyj opcji Utwórz węzły dla systemów gości, aby automatycznie dodawać maszyny wirtualne i kontenery do Atlas, gdy ich adresy IP są znane.

Przejrzyj alerty i pakiety monitorowania

Sprawdź automatycznie przypisane pakiety monitorowania i dostosuj progi, jeśli środowisko Proxmox charakteryzuje się nietypowymi wzorcami wykorzystania zasobów.

Najlepsze praktyki

Używaj API token
Preferuj API token zamiast uwierzytelniania za pomocą nazwy użytkownika i hasła.
Przypisz minimalne wymagane uprawnienia
Użyj roli PVEAuditor na poziomie /, aby zapewnić dostęp tylko do odczytu na potrzeby monitorowania.
Monitoruj zarówno klaster, jak i węzły
Monitorowanie klastra wykrywa problemy ze współdzieloną infrastrukturą, natomiast monitorowanie węzłów wykrywa problemy z zasobami na poziomie hosta.
Włącz Guest Agent dla maszyn wirtualnych QEMU
Bez Proxmox Guest Agent adres IP maszyny wirtualnej QEMU może być niedostępny dla NetCrunch.
Przejrzyj progi datastore
Alerty dotyczące magazynów danych powinny odzwierciedlać przyjęte zasady operacyjne. Małe środowiska Proxmox mogą wymagać innych progów wolnego miejsca niż duże klastry.
Monitoruj IO Wait i metryki pressure stall
Samo wysokie wykorzystanie procesora nie wyjaśnia każdego problemu z wydajnością. IO Wait i metryki pressure stall pomagają identyfikować wąskie gardła magazynów danych i harmonogramowania.
Dodawaj systemy gości do Atlas, gdy jest to przydatne
Węzły systemów gości zapewniają lepszy wgląd, ale dodawaj je automatycznie tylko wtedy, gdy adresowanie IP i nazewnictwo są niezawodne.

Rozwiązywanie problemów

Klaster nie został wykryty

Sprawdź następujące elementy:

  • Proxmox API jest dostępne z NetCrunch Server lub Probe
  • Dane uwierzytelniające są prawidłowe
  • Użytkownik lub token ma przypisaną rolę PVEAuditor na poziomie /
  • Wybrany węzeł Proxmox jest członkiem oczekiwanego klastra

Węzły Proxmox nie są dodawane automatycznie

Sprawdź, czy opcja Utwórz węzły atlasu dla węzłów Proxmox jest włączona.

Upewnij się również, że NetCrunch może rozpoznać i osiągnąć adresy węzłów Proxmox zwracane przez Proxmox API.

Systemy gości nie są dodawane automatycznie

Sprawdź, czy opcja Utwórz węzły dla systemów gości jest włączona.

W przypadku maszyn wirtualnych QEMU sprawdź, czy:

  • Proxmox Guest Agent jest zainstalowany
  • Proxmox Guest Agent jest uruchomiony
  • Proxmox przekazuje adres IP systemu gościa za pośrednictwem API

W przypadku kontenerów LXC sprawdź, czy Proxmox może przekazywać adres sieciowy kontenera.

Metryki systemów gości są niekompletne

Niektóre metryki zależą od typu systemu gościa i dostępności danych Proxmox.

Na przykład:

  • Metryki swapu systemu gościa są dostępne wyłącznie dla kontenerów LXC
  • Wykrywanie adresu IP maszyn wirtualnych QEMU wymaga Guest Agent
  • Metryki pressure stall zależą od obsługi po stronie systemu gościa i hosta

Podsumowanie

Monitorowanie Proxmox w NetCrunch zapewnia hierarchiczny wgląd w cały stos Proxmox VE.

Monitorowane są:

  • Klastry Proxmox
  • Węzły Proxmox
  • Datastore i wykorzystanie magazynów danych
  • Kondycja Ceph
  • Maszyny wirtualne QEMU
  • Kontenery LXC
  • Wykorzystanie zasobów systemów gości i warunki pressure stall

Łącząc monitorowanie na poziomie klastra, monitorowanie na poziomie węzłów oraz automatyczne wykrywanie systemów gości, NetCrunch zapewnia administratorom kompletny operacyjny wgląd w infrastrukturę Proxmox z jednego miejsca.