What you'll be able to do
- Design effective monitoring strategies
- Build comprehensive dashboards
- Configure intelligent alerting
- Implement SLOs and error budgets
- Set up distributed tracing
Modules
-
01
Logging Foundations
Structured logging, log collection, and analysis patterns
-
02
Prometheus Metrics
Metrics collection, exporters, recording rules with Prometheus
-
03
Grafana Dashboards & Visualization
Building effective dashboards, alerting, and data visualization
-
04
Alerting & Incident Response
Alert management, escalation, SLOs, and incident response workflows
-
05
Distributed Tracing & APM
OpenTelemetry, Jaeger, APM tools, and performance monitoring
-
06
Observability Strategy
Mindset, signal selection, and instrumentation planning
-
07
Metrics Engineering
Model metrics, optimize queries, and improve alert quality
-
08
Logging at Scale
Pipeline design, parsing, retention, and cost control
-
09
Observability Field Guide
Failure patterns, investigations, and evidence
-
10
Observability Platform
Operate the platform that stores and serves signals
-
11
SLO Operations
Define SLOs, manage error budgets, and align teams
-
12
Incident Analytics
Measure detection, response, and recovery to improve reliability