Открыто

Вся база по Observability [Тариф Стандарт] [Balun.Courses] [Виталий Лихачев]

Тема в разделе "Курсы по администрированию", создана пользователем Топикстартер, 18 июл 2026.

Основной список: 7 участников

  1. 18 июл 2026
    #1
    Топикстартер
    Топикстартер Член клуба

    Складчина: Вся база по Observability [Тариф Стандарт] [Balun.Courses] [Виталий Лихачев]

    Screenshot_1.png

    Лучшие практики по нарастающей сложности — от маленьких до BigTech-компаний
    Учимся делать информативные дашборды, поставлять логи / метрики / трейсы, быстро находить инциденты и правильно интерпретировать данные

    Подойдет разработчикам из небольших и bigteсh-компаний
    backend
    devops
    от уровня middle
    Примеры на Go, но знания применимы ко всем ЯП
    Интеграция observability универсальная — различия в языках минимальны. Если переживаешь за усвоение материала, пробегись по основам Go. Это бесплатно и займет пару вечеров

    В рамках курса научимся:
    • Строить информативные дашборды, алерты и интерпретировать данные на уровне Senior’ов и TeamLead’ов
    • Использовать Prometheus, Grafana и Jaeger под разные задачи с учетом плюсов и минусов каждого инструмента
    • Строить полезные метрики, которые не расходуют лишние ресурсы на хранение
    • Писать логи, в которых легко разобраться
    • Правильно оценивать нагрузку для новой фичи или сервиса и уменьшить количество инцидентов
    • Управлять стабильностью системы, предсказывать ее поведение и находить причину инцидента за пару минут
    Программа
    9 уроков • highload-подходы • много кода
    1. Введение в Observability
    2. Метрики: основные концепции и работа с ними
    3. Запросы и работа с метриками
    4. Визуализация и управление метриками
    5. Логирование и структурированные логи
    6. Трейсинг
    7. Управление алертингом
    8. Observability как часть SRE — практики и проблемы эксплуатации
    9. Стратегии для больших систем
    Введение в Observability

    Теория:
    • Основные аспекты Observability — метрики, логи, трейсы, профили
    • Зачем нужна наблюдаемость для микросервисов
    • Структурные отличия observability для монолитов и микросервисов
    • Инструменты Observability: Prometheus, Graphite, Grafana, Grafana Alloy, Grafana Pyroscope, Grafana Tempo, OpenTelemetry, Loki, Jaeger, Clickhouse
    Практика:
    • Настройка базового проекта на Go
    • Интеграция базового мониторинга с Prometheus и с push gateway
    • Интеграция с graphite
    • Интеграция с Loki
    • Примеры использования инструментов observability
    • Пример сбора runtime-метрик golang приложения
    Метрики: основные концепции и работа с ними

    Теория:
    • Разные подходы к работе с метриками: push vs pull
    • Архитектура Prometheus
    • Кардинальность метрик: что это и почему важно
    • Влияние системы сбора метрик на производительность
    • Эффективное именование метрик
    • Разница бизнес-метрик и технических метрик
    • Влияние метрик на принятие бизнес-решений
    Практика:
    • Создание и экспорт пользовательских метрик: счетчики, гистограммы, таймеры, скаляры (gauges), summaries
    • Анализ влияния высокой кардинальности на производительность
    Запросы и работа с метриками

    Теория:
    • Как правильно писать запросы для визуализации — PromQL, VictoriaMetricsQL, SQL-источники
    • Нюансы агрегаций — sum, avg, rate, increase, histogram_quantile
    • Квантили, перцентили и как их корректно использовать
    • Частые ошибки в запросах — double aggregation, неправильный rate, слишком «дорогие» запросы
    Практика:
    • Написание базовых и сложных запросов
    • Сравнение разных способов агрегации одной и той же метрики
    • Управление метриками: агрегация, квантили, экспоненциальное скользящее среднее
    Визуализация и управление метриками

    Теория:
    • Лучшие практики построения дашбордов
    • Антипаттерны построения дашбордов
    • Типы графиков и их применение: временные ряды, heatmap, гистограммы, gauges, etc.
    • Как избежать перегруженных дашбордов
    • 4 Golden Signals и их значение для мониторинга
    • RED/USE методы построения дашбордов
    Практика:
    • Создание дашбордов в Grafana для анализа Golden Signals
    • Практическое задание: построить дашборд для микросервиса
    • Продвинутая настройка Grafana: версионирование дашбордов, интеграция с несколькими источниками данных, переменные, зависимости переменных, кастомные визуализации, annotations, группировка панелей
    Логирование и структурированные логи

    Теория:
    • Подходы к логированию: текстовые и структурированные логи
    • Стандарты форматирования логов — JSON, OpenTelemetry Logs
    • Фильтрация и нормализация логов
    • Скрытие конфиденциальной информации
    • Уход от ELK в сторону Grafana stack, плюсы и минусы использования ELK
    Практика:
    • Интеграция структурированного логирования с logrus или zap, использование slog
    • Настройка Loki для агрегации логов
    • Использование fluentbit для фильтрации и отправки логов
    • Написание запросов в Loki для анализа логов
    • Уменьшение объема логов без потери данных
    Трейсинг

    Теория:
    • Что такое трейсы и зачем они нужны
    • Основы работы OpenTelemetry Trace
    • Корреляция трейсов, логов и метрик
    • OpenTelemetry как единый стандарт для метрик, логов и трейсов
    • Архитектура и возможности OpenTelemetry
    • Преимущества и сложности перехода на OpenTelemetry
    • Observability асинхронных систем
    • Автоматическая интеграция OpenTelemetry на уровне инфраструктуры (http, sql), интеграция и корреляция на стыке систем (сервис + БД + API gateway)
    • Обзор последних трендов: eBPF для мониторинга (OpenTelemetry), AIOps
    Практика:
    • Интеграция OpenTelemetry в приложение. Golang zero code instrumentation
    • Настройка Jaeger для распределенного трейсинга
    • Настройка Grafana Alloy для трейсинга
    • Анализ проблем на основе трейсов (высокая latency, ошибки)
    • Корреляция логов / метрик / трейсов (OpenTelemetry semantic conventions)
    • Отладка сети с помощью OpenTelementry
    • Автоматизация прокидывания requestId сквозь разные слои сервисов
    • Миграция с Prometheus + Jaeger на OpenTelemetry
    • Настройка сборщиков для метрик, логов, трейсов через OpenTelemetry Collector
    Управление алертингом

    Теория:
    • Как писать запросы для алертов (prometheus, graphite)
    • Алерты из метрик, алерты из логов
    • Настройка порогов для Golden Signals
    • Предотвращение перегрузки системы алертинга
    • Автоматизация алертинга
    • Дашборды для SLO
    Практика:
    • Настройка Alertmanager
    • Настройка алертинга в Grafana
    • Написание запросов для сложных алертов
    • Интеграция с уведомлениями (Slack, Email, PagerDuty)
    • Маскирование ошибок неправильными запросами (примеры: transformNull, пропадание метрики)
    Observability как часть SRE — практики и проблемы эксплуатации

    Теория:
    • Введение в SRE и роль Observability
    • Error Budgets
    • Применение Top-Down анализа
    • Баланс между объемом данных и их ценностью: что хранить, а что — игнорировать
    • Построение системы observability для N-сервисов
    • Обработка синхронных/асинхронных взаимодействий
    • Кейсы деградации цепочек вызовов
    Практика:
    • Разработка observability для системы из нескольких Go-сервисов
    • Анализ деградации цепочек вызовов через трейсы и метрики
    Стратегии для больших систем

    Теория:
    • Построение наблюдаемости для системы из множества сервисов
    • Подходы к массовой интеграции метрик в микросервисы: конфигурация экспортеров и SDK, шаблонизация дашбордов
    • Автоматизация алертинга: CI/CD для observability
    • Автоматизация деплоя observability-стека
    • Как не перегрузить систему мониторинга сложными алертами
    • Синхронные и асинхронные взаимодействия: мониторинг и алертинг
    • Дизайн метрик и root cause analysis
    • Борьба с избыточным количеством метрик
    • Предсказания
    • AI для алертинга
    • Использование service mesh istio для улучшения наблюдаемости системы, kiali для визуализации
    • Автоматизация сбора метрик на уровне инфраструктуры, header propagation
    Практика:
    • Создание комплексного дашборда для системы из N-сервисов
    • Написание эффективных запросов
    • Настройка cross-service трейсов
    • Проведение RCA с использованием метрик, логов и трейсов
    • Автоматизация конфигураций метрик и алертов с помощью Helm и Terraform

    Тариф Стандарт
    Стоимость 41600 руб.
    Скрытая ссылка
     
    Последнее редактирование модератором: 19 июл 2026
    2 пользователям это понравилось.
  2. Последние события

    1. abrakadabra
      abrakadabra участвует в складчине.
      26 июл 2026
    2. Serg-PSA13
      Serg-PSA13 участвует в складчине.
      22 июл 2026
    3. skladchik.com
      Нужен организатор складчины.
      21 июл 2026
    4. dlmka1
      dlmka1 участвует в складчине.
      20 июл 2026

    Последние важные события

    1. skladchik.com
      Нужен организатор складчины.
      21 июл 2026
    2. skladchik.com
      Назначен организатор складчины.
      18 июл 2026