Объяснение
Метрика показывает тенденцию, лог — событие, trace — путь запроса. Alert должен отражать пользовательский ущерб или близкий риск. Мониторинг только загрузки CPU не описывает доступность сервиса.
Задача для самостоятельного решения
CPU 10%, но пользователи получают timeout. Какой сигнал важнее?
Показать разбор ответа
Доля успешных запросов и latency. Причина может быть в ожидании БД или сети, поэтому низкий CPU не доказывает здоровье.