Система мониторинга серверной инфраструктуры и приложений

Назначение решения

Данное типовое решение предназначено для организации централизованного контроля работоспособности серверной инфраструктуры, на которой запущены бизнес-приложения. Основная задача — обеспечить непрерывность и предсказуемость работы сервисов за счёт своевременного выявления проблем на всех ключевых уровнях: операционные системы, базы данных, сетевые службы и среда виртуализации.

Решение охватывает четыре основных уровня:

  1. Операционные системы — Linux и Windows с полным набором метрик: CPU, память, диски, сеть, процессы и системная информация.
  2. Базы данных — MySQL, PostgreSQL, Redis с мониторингом производительности, кэша, репликации и блокировок.
  3. Сетевые службы — HTTP, HTTPS, FTP, SSH, SMTP и другие протоколы с проверкой доступности портов.
  4. Виртуализация VMware — контроль гипервизоров ESXi и гостевых виртуальных машин без установки агентов.

Все уровни интегрированы в единую систему с автоматическим обнаружением компонентов и готовыми триггерами, что позволяет администратору видеть полную картину состояния инфраструктуры на одном дашборде.

Принцип работы и используемые протоколы

Camkeeper использует несколько протоколов и методов сбора данных в зависимости от типа оборудования и служб:

  • Zabbix-агент (пассивный или активный) — для детального сбора метрик с серверов Linux и Windows. Агент может работать как по запросу от Camkeeper, так и в активном режиме, что упрощает работу за NAT.
  • SNMP (v2c/v3) — для сбора аппаратных и сетевых метрик с серверов и сетевого оборудования, где установка агента невозможна или нежелательна.
  • Специализированные API — для интеграции с VMware (vSphere API) и для мониторинга баз данных (ODBC, встроенные SQL-запросы через агент).
  • TCP/UDP-проверки — для контроля доступности сетевых служб путём попытки установить соединение с соответствующим портом.
  • HTTP-запросы — для сбора метрик с Prometheus-экспортеров (например, node_exporter) или от веб-сервисов.

Шаблоны активно используют низкоуровневое обнаружение (LLD) для автоматического выявления динамических объектов: сетевых интерфейсов, файловых систем, блочных устройств, баз данных, репликаций и виртуальных машин. Это исключает ручную настройку и гарантирует, что мониторинг автоматически подстроится под изменения инфраструктуры.

Ключевые точки контроля и их практическая ценность

1. Операционные системы (Linux и Windows)

Базовый мониторинг ОС обеспечивает контроль фундаментальных ресурсов, от которых зависит стабильность любых приложений:

  • Процессор — общая загрузка, детализация по типам задач (user, system, iowait, interrupt, steal), средняя нагрузка (load average) за 1, 5 и 15 минут, контекстные переключения и прерывания. Позволяет выявлять перегрузки, вызванные как приложениями, так и системными процессами, а также диагностировать проблемы с драйверами или гипервизором.
  • Память — доступная память (с учётом буферов и кэша), использование подкачки (swap) в байтах и процентах. Критично для предотвращения замедлений из-за нехватки RAM и активной подкачки, которая резко снижает производительность.
  • Диски — файловые системы (заполнение, прогноз, inodes), блочные устройства (скорость чтения/записи, очередь, утилизация, среднее время отклика). Позволяет предотвратить аварийные остановки из-за переполненных разделов и диагностировать проблемы с производительностью дисковой подсистемы.
  • Сеть — интерфейсы (входящий/исходящий трафик в битах/сек, ошибки, отброшенные пакеты, статус линка, тип интерфейса). Помогает оперативно реагировать на потерю соединения и выявлять проблемы качества связи, которые могут влиять на работу сетевых приложений.
  • Процессы — общее количество процессов и количество запущенных, контроль лимитов (максимальное число процессов и открытых файловых дескрипторов). Позволяет обнаруживать аномалии, например, утечки процессов или недостаточные системные лимиты.

2. Базы данных

Для приложений, использующих СУБД, мониторинг баз данных — один из самых критичных. Camkeeper предлагает шаблоны для MySQL, PostgreSQL и Redis:

  • MySQL — отслеживаются медленные запросы, блокировки InnoDB (время ожидания, количество ожиданий), эффективность и утилизация буферного пула, состояние репликации (лаг, статус I/O и SQL потоков), количество подключений и ошибок. Позволяет быстро находить причины замедления приложений, связанные с запросами к БД, и предотвращать проблемы с репликацией.
  • PostgreSQL — мониторинг кэш-попаданий, транзакций (commit/rollback), блокировок, фоновых процессов (bgwriter, checkpoints), репликации (лаг, статус потоков), а также автоматическое обнаружение всех баз данных и их размеров. Дополнительно отслеживаются замороженные XID для предотвращения «заворачивания» транзакций — критической проблемы, которая может привести к остановке СУБД.
  • Redis — мониторинг использования памяти (включая фрагментацию), количества операций в секунду, репликации (лаг, статус потоков), медленных запросов (slowlog) и состояния персистентности (RDB/AOF). Позволяет вовремя заметить проблемы с памятью, которые могут привести к остановке кэша или потере данных.

3. Сетевые службы (HTTP, FTP, SSH и др.)

Проверка доступности сетевых портов позволяет убедиться, что приложение отвечает на запросы. Шаблоны для служб (HTTP, HTTPS, FTP, SSH, SMTP, POP3, IMAP, LDAP, Telnet) выполняют простую TCP/UDP-проверку и при отсутствии ответа в течение нескольких последовательных попыток генерируют триггер. Это базовый, но надёжный способ обнаружить, что веб-сервер, почтовый сервер или любая другая служба перестала отвечать.

4. Виртуализация VMware

Для сред, где приложения запущены на виртуальных машинах, шаблоны VMware обеспечивают мониторинг гипервизоров и гостевых ВМ без необходимости установки агентов на каждую виртуалку:

  • Гипервизоры ESXi — контролируются аппаратные характеристики (модель CPU, количество ядер, частота, общая память), загрузка CPU и памяти, состояние здоровья (общий статус, статус сенсоров), автоматически обнаруживаются хранилища данных (datastore) с мониторингом свободного места и задержек чтения/записи.
  • Гостевые ВМ — отслеживаются состояние питания, использование CPU (включая «CPU ready» — время ожидания доступа к физическому ядру), память (ballooning, сжатие, swap, private/shared), дисковые и сетевые операции (IOPS, пропускная способность). Также автоматически обнаруживаются файловые системы внутри ВМ (если установлены VMware Tools), что позволяет контролировать заполнение дисков на уровне гостевой ОС.

Требования к целевому оборудованию

Для полноценной работы решения необходимо, чтобы:

  • На серверах ОС (Linux, Windows) был установлен и настроен Zabbix-агент соответствующей версии (рекомендуется 4.4+), а также обеспечена сетевая доступность. Альтернативно — включён SNMP-агент с корректной community-строкой.
  • Для мониторинга баз данных через агент требуется установка клиентского ПО (например, MySQL-клиент) и специального пользователя с минимальными правами (USAGE, REPLICATION CLIENT, PROCESS, SHOW DATABASES, SHOW VIEW), а также файл .my.cnf или pgpass для аутентификации.
  • Для мониторинга сетевых служб достаточно открытого порта и разрешения на TCP-подключения со стороны Camkeeper.
  • Для VMware необходим доступ к vCenter или ESXi по HTTPS, учётные данные с правами на чтение и настроенные макросы {$URL}, {$USERNAME}, {$PASSWORD}.
  • Для мониторинга через SNMP на целевых устройствах должен быть включён SNMP-агент и настроена community-строка (используется макрос {$SNMP_COMMUNITY}).

При соблюдении этих условий шаблоны работают в полном объёме, обеспечивая комплексный контроль всех уровней.

Важные ограничения и что нужно сделать перед внедрением

Приведённое типовое решение — это методология, а не магия. Camkeeper предоставляет готовые шаблоны, но для их работы необходимо учесть следующие моменты:

  • 1. Настройка параметров доступа. Для каждого шаблона требуется указать корректные учётные данные: community-строки для SNMP, логины/пароли для баз данных, адреса серверов и порты. Все параметры задаются через макросы на уровне хоста и обязательны для сбора данных.
  • 2. Зависимость от поддержки протоколов. Не все устройства поддерживают все OID или API. Например, для мониторинга файловых систем гостевых ВМ VMware необходимы установленные VMware Tools, а некоторые старые версии Windows могут не поддерживать определённые счетчики производительности. Рекомендуется перед внедрением проверять доступность метрик с помощью встроенных средств диагностики.
  • 3. Фильтры и макросы. Шаблоны содержат гибкие фильтры для автоматического обнаружения интерфейсов, файловых систем и процессов. Их поведение зависит от значений макросов (например, {$NET.IF.IFNAME.NOT_MATCHES}). Без настройки этих фильтров под вашу инфраструктуру возможен сбор избыточной информации или пропуск важных элементов. Например, по умолчанию исключаются петлевые интерфейсы (lo), docker-мосты, но если у вас используются нестандартные имена, их нужно добавить в исключения.
  • 4. Специфика отдельных протоколов. Например, для мониторинга MySQL через ODBC требуется настроить DSN и указать {$MYSQL.DSN}. Для мониторинга PostgreSQL через агент нужно создать пользователя zbx_monitor и настроить файл pgpass. Эти шаги описаны в документации к шаблонам и являются обязательными.
  • 5. Версии агентов и ОС. Некоторые метрики могут быть недоступны в старых версиях агентов или операционных систем. Например, в Windows XP отсутствует поддержка ifXTable, а в Linux для получения некоторых метрик CPU требуется ядро с поддержкой соответствующих счетчиков.
  • 6. Прогнозирование заполнения дисков. Функция timeleft() рассчитывает время до полного заполнения диска на основе линейного тренда за последний час. Для дисков с неравномерной нагрузкой это может давать неточные прогнозы, но в большинстве случаев сигнал оказывается полезным.
  • Обновление библиотеки. Мы постоянно дополняем и актуализируем шаблоны, но в некоторых случаях при изменении прошивок или обновлении ядра отдельные OID или пути могут меняться. Обновления предоставляются бесплатно в течение всего срока технической поддержки.

Camkeeper даёт фундамент, но тонкая настройка под вашу инфраструктуру — задача администратора. Мы всегда готовы помочь, но ожидаем от пользователя понимания основ сетевых протоколов и принципов мониторинга. Начинайте внедрение с одного-двух критически важных компонентов, отладьте сбор данных и работу триггеров, затем масштабируйте подход на всю инфраструктуру.

Заключение

Данное типовое решение предлагает проверенный подход к построению комплексной системы мониторинга серверной инфраструктуры, на которой работают приложения. Оно решает ключевую задачу: обеспечивает стабильную и предсказуемую работу сервисов за счёт своевременного выявления проблем на всех уровнях — от ОС и баз данных до сетевых служб и виртуализации. Решение готово к внедрению и не требует разработки пользовательских сценариев — все элементы уже реализованы в библиотеке шаблонов Camkeeper.

При этом важно помнить, что Camkeeper — это инструмент, а не волшебная палочка. Его эффективность напрямую зависит от правильной настройки параметров доступа, корректной фильтрации, а также адаптации порогов под конкретные нагрузки. Но именно так и строится профессиональный мониторинг: на фундаменте готовых решений и с пониманием собственных задач.

Система исправна!
Нажмите на схему для увеличения

Оценить работу серверной инфраструктуры и приложений в один взгляд

Для ИТ-администратора и службы эксплуатации критически важно не просто знать, что сервер перегружен, а мгновенно понимать, где именно возникла проблема — на каком хосте, в какой базе данных или сетевой службе. Camkeeper позволяет наложить пиктограммы серверов, баз данных, сетевых служб и виртуальных машин на логическую карту сети или географическую карту объекта. При возникновении инцидента — высокая загрузка CPU, нехватка памяти, падение репликации БД, недоступность веб-сервиса — проблемный элемент подсвечивается красным. Администратор за секунду видит уязвимое место инфраструктуры и может оперативно принять меры по восстановлению сервиса.

Полный контроль за системой в любой период

Система автоматически формирует отчёты о работоспособности каждого сервера, базы данных и сетевой службы за любой выбранный период. Вы можете посмотреть, как изменялась загрузка CPU, использование памяти, количество медленных запросов в MySQL или время отклика веб-сервера вчера, неделю или месяц назад. Отчёты доступны в формате инфографики, выгрузка прямо из интерфейса в PDF или Excel. Это позволяет не только моментально реагировать на текущие неполадки, но и проводить комплексный ретроспективный анализ — например, выявлять серверы с систематическими проблемами производительности или планировать расширение ресурсов до того, как они станут узким местом.

Умные уведомления

Camkeeper опрашивает состояние каждого сервера, базы данных и службы каждые 30 секунд. При обнаружении отклонения — например, загрузка CPU выше 90%, недостаток оперативной памяти, падение репликации PostgreSQL, недоступность HTTP-порта — система выполняет пятикратную перепроверку. Это позволяет отсечь случайные сетевые флуктуации и исключить ложные срабатывания.

Если инцидент подтверждён, Camkeeper отправляет уведомление по всем настроенным каналам: E-mail и Telegram. Пользователь самостоятельно определяет список получателей для каждого типа событий. Уведомление содержит идентификатор неисправного сервера или службы, суть ошибки (например, «критическая загрузка CPU», «задержка репликации») и точное время возникновения. При восстановлении нормальной работы система снова проводит пятикратную проверку и отправляет повторное уведомление о том, что проблема устранена.

Безопасно

Camkeeper — полностью автономное решение. Все данные о работоспособности серверной инфраструктуры хранятся на самом устройстве и не передаются в облачные сервисы третьих лиц. Информация доступна только вам и остаётся внутри вашего периметра безопасности.

Отсутствие влияния на наблюдаемую инфраструктуру. Camkeeper работает исключительно в режиме чтения: он опрашивает серверы через Zabbix-агент, SNMP, API VMware или выполняет TCP-проверки, не внося изменений в их конфигурацию и не создавая дополнительной нагрузки на их процессоры. Риск нарушить работу действующих приложений полностью исключён.

Стандарт умного IT-мониторинга

Готовое решение «из коробки». Не нужно настраивать сервер, базу данных и писать скрипты — просто подключите и работайте.

Более 170 преднастроенных шаблонов. Поддержка всех основных платформ и служб: Linux, Windows, MySQL, PostgreSQL, Redis, HTTP, FTP, SSH, SMTP, VMware и многих других. Шаблоны уже содержат все необходимые метрики и триггеры для комплексного контроля инфраструктуры.

Работа по всем актуальным протоколам. ICMP, SNMP, Zabbix-агент, ODBC, VMware API, TCP/UDP-проверки — Camkeeper умеет собирать метрики с любого IP-устройства и глубоко интегрироваться с базами данных и виртуализацией.

Camkeeper — это ответ на вопрос «как быстро и недорого навести порядок в серверной инфраструктуре на десятках и сотнях объектов». Внедрение занимает существенно меньше времени и ресурсов, чем развёртывание и настройка универсальных систем мониторинга «с нуля», а специализация именно на ИТ-инфраструктуре делает его максимально эффективным инструментом для ИТ-администраторов и служб эксплуатации.

Дешевле, быстрее, надёжнее

Camkeeper является готовым преднастроенным решением для мониторинга серверной инфраструктуры и приложений. Внедрение занимает существенно меньше времени и не требует тонкой настройки и доработок, а также на порядок дешевле, чем доступные аналогичные решения для мониторинга.

  • Взаимодействие по различным протоколам передачи данных, включая SNMP, Zabbix-агент, VMware API, ODBC.
  • Легкое включение: не нужны специальные знания для запуска
  • Специализация для ИТ-инфраструктуры и приложений
  • Готовое русифицированное программно-аппаратное решение
  • Встроенный канал передачи данных
  • Сертифицированное решение, техническая поддержка
  • Подключение внешней антенны для усиления сигнала и передачи данных
  • Интеграция с ITSM
  • Оповещение через e-mail, Telegram
  • Наличие структурной (логической) интерактивной карты
  • Наложение пиктограмм устройств на план БТИ, географическую карту
  • 170 преднастроенных шаблонов контроля устройств
  • Поддержка всех производителей оборудования для систем безопасности

30 минут настройки

Подобрать за 30 секунд