Kategorie: Linux (wszystkie) , DevOps. CI/CD, Ansible, Docker i Kubernetes, cloud
O szkoleniu
Szkolenie o tym, jak zbudować monitoring, który naprawdę ostrzega, a nie tylko rysuje wykresy. Przez trzy dni uczestnicy budują monitoring przykładowego środowiska – serwerów Linux, aplikacji webowej z bazą danych, urządzeń sieciowych i aplikacji w kontenerach – na najpopularniejszym dziś zestawie open source: Prometheus zbiera metryki, Grafana je pokazuje, Alertmanager powiadamia właściwe osoby, a Loki przechowuje logi.
Zaczynamy od podstaw: co i po co mierzyć, jak działa Prometheus i język zapytań PromQL. Już pierwszego dnia działa monitoring serwerów z dashboardem i alertem. Kolejne dni to eksportery (także SNMP dla sprzętu sieciowego), alerty, które mają sens, logi i monitoring Kubernetesa.
Po trzech dniach zajęć:
- będziesz wiedzieć, co warto mierzyć w serwerach, sieci i aplikacjach – i czego nie,
- samodzielnie zainstalujesz i skonfigurujesz Prometheusa, eksportery i Grafanę,
- napiszesz zapytania PromQL i LogQL i zbudujesz z nich czytelne dashboardy,
- zaprojektujesz alerty, które trafiają do właściwych osób i nie zalewają ich szumem,
- połączysz metryki z logami, żeby szybciej znaleźć przyczynę awarii,
- zaplanujesz monitoring całego środowiska – od pojedynczego serwera po klaster Kubernetesa.
Jeśli dziś pracujesz z Nagiosem lub Zabbixem, łatwo odnajdziesz się w znanych pojęciach – pokazujemy, jak przenieść je na nowy zestaw narzędzi. Asystentów AI używamy tam, gdzie realnie pomagają: przy pisaniu i wyjaśnianiu zapytań oraz w analizie logów – zawsze ze sprawdzeniem wyniku.
Monitoring z Prometheusem i Grafaną jest też jednym z modułów kursu DevOps Engineer. To szkolenie jest dla tych, którzy potrzebują tego tematu osobno i dokładniej – ma trzy dni zamiast jednego.
Szkolenie przyda się każdemu, kto odpowiada za to, żeby systemy działały: administratorom Linux i Windows, inżynierom DevOps i SRE, administratorom sieci, programistom i liderom zespołów utrzymujących własne usługi, zespołom utrzymania i dyżurów, a także osobom, które planują zastąpienie starszego systemu monitoringu.
Czas trwania
3 dni
Program
- Co i po co mierzyć
- metryki, logi i ślady – co daje każde z nich
- co mierzyć w serwerach, usługach i aplikacjach: cztery złote sygnały, metody USE i RED
- model pobierania danych (pull) a klasyczne systemy z agentami – porównanie z Nagiosem i Zabbixem
- Prometheus – zbieranie metryk
- architektura: serwer, eksportery, baza szeregów czasowych, Alertmanager
- instalacja i konfiguracja, cele (targets) i etykiety
- node_exporter – monitorowanie serwerów Linux
- typy metryk: counter, gauge, histogram, summary
- PromQL – zapytania do metryk
- selektory i filtrowanie po etykietach
- tempo zmian i agregacje: rate, increase, sum, avg, by, without
- percentyle z histogramów
- reguły nagrywania (recording rules)
- pisanie i wyjaśnianie zapytań z pomocą AI – i jak sprawdzić wynik
- Grafana – pierwsze dashboardy i alert
- źródła danych, panele, zakresy czasu
- gotowe dashboardy z biblioteki – kiedy pomagają, a kiedy przeszkadzają
- ćwiczenie: dashboard i pierwszy alert dla monitorowanych serwerów
- Eksportery i źródła danych
- blackbox_exporter – dostępność stron i usług, porty, ważność certyfikatów TLS
- SNMP i snmp_exporter – monitoring przełączników, routerów i innych urządzeń sieciowych
- eksportery baz danych i usług, np. PostgreSQL, MySQL, serwer WWW
- metryki własnej aplikacji – endpoint /metrics i biblioteki klienckie
- automatyczne wykrywanie celów (service discovery)
- Alertowanie w praktyce
- reguły alertów: progi, czas trwania, etykiety i opisy
- Alertmanager: routing, grupowanie, wyciszenia, tłumienie alertów zależnych
- kanały powiadomień: e-mail, komunikatory zespołowe, systemy dyżurów
- alerty, na które warto reagować – objawy zamiast przyczyn, walka z szumem
- alerty w Grafanie a w Alertmanagerze – kiedy które
- Dashboardy do codziennej pracy
- zmienne i szablony – jeden dashboard dla wielu serwerów i usług
- foldery, uprawnienia, zespoły
- dashboardy jako kod: eksport, wersjonowanie, automatyczne wdrażanie
- Logi w Grafana Loki
- architektura Loki i różnice wobec systemów pełnotekstowych (ELK)
- zbieranie logów kolektorem (np. Grafana Alloy): logi systemowe, aplikacyjne, JSON
- LogQL: filtrowanie, parsowanie, metryki wyliczane z logów
- alerty oparte na logach; metryki i logi obok siebie w Grafanie
- analiza logów z pomocą AI – możliwości, ograniczenia i ryzyko wysyłania danych
- Kontenery i Kubernetes
- metryki kontenerów i klastra: cAdvisor, kube-state-metrics
- gotowy zestaw do monitorowania klastra (kube-prometheus-stack) – co daje, a co trzeba dostroić
- ślady (traces) – wprowadzenie: OpenTelemetry i Grafana Tempo, kiedy warto
- Utrzymanie systemu monitoringu
- retencja danych i miejsce na dysku
- kardynalność etykiet – najczęstsza przyczyna problemów z wydajnością
- wysoka dostępność i długoterminowe przechowywanie metryk – przegląd rozwiązań
- bezpieczeństwo: uwierzytelnianie, TLS, dostęp do Grafany
- Projekt końcowy
- monitoring przykładowego środowiska od zera: serwery, aplikacja, baza danych, urządzenie sieciowe
- dashboardy, alerty z routingiem, logi powiązane z metrykami
Training also available in English .
Przeznaczenie i wymagania
Szkolenie jest przeznaczone przede wszystkim dla:
- administratorów serwerów Linux i Windows, którzy wdrażają lub przejmują monitoring oparty na Prometheusie i Grafanie,
- inżynierów DevOps i SRE, którzy mają w środowisku gotowy monitoring, ale chcą go rozumieć i dostroić,
- administratorów sieci, którzy chcą monitorować urządzenia sieciowe obok serwerów i usług,
- programistów i liderów zespołów odpowiedzialnych za działanie własnych aplikacji,
- osób planujących migrację z Nagiosa, Zabbixa lub innego starszego systemu monitoringu.
Od uczestników oczekujemy:
- swobodnej pracy w linii poleceń Linuksa – edycja plików konfiguracyjnych, zarządzanie usługami, przeglądanie logów,
- znajomości podstaw sieci: adres IP, port, HTTP, DNS,
- umiejętności czytania plików YAML (w nim zapisuje się konfigurację Prometheusa i Alertmanagera).
Przydatna, choć niekonieczna, jest podstawowa znajomość Dockera – środowisko ćwiczeniowe uruchamiamy w kontenerach. Znajomość Kubernetesa nie jest wymagana.
Osobom bez podstaw Linuksa polecamy najpierw kurs Administrator Linuksa. Zespołom, które utrzymują Prometheusa w dużej skali, proponujemy szkolenie zamknięte z programem dopasowanym do ich środowiska.
Certyfikaty
Uczestnicy szkolenia otrzymują imienne certyfikaty sygnowane przez ALX.