Мы используем cookies для корректной работы сайта и подключаем аналитику (Яндекс.Метрика), чтобы понимать, что улучшать

🚩 Симптом. В системных журналах Windows фиксируются события источника disk с кодами 7 (обнаружен сбойный блок), 11 (драйвер обнаружил ошибку контроллера) и 51 (ошибка при операции подкачки). В Linux – ошибки ввода-вывода, коды sense key, ошибки носителя. Внешне файлы доступны.
Важно: сами по себе эти коды не всегда означают деградацию диска. По документации Microsoft, событие 51 фиксируется и при проблемах драйвера, и при нехватке места, а событие 11 может указывать на неисправный кабель или контроллер. Вывод делается по совокупности с показателями SMART и статусом массива.
Критерий. Любой статус RAID-массива, отличный от Optimal. Рост атрибутов SMART: число переназначенных секторов, число секторов в ожидании переназначения, число неисправимых ошибок при автономном сканировании.
Риск. При подтверждении деградации по SMART и статусу массива ситуация критична: массив в состоянии Degraded или с накопленными ошибками приводит к распаду и потере данных без возможности восстановления. Если SMART в норме, а ошибки продолжаются, причину следует искать в контроллере, кабеле или драйвере.
Самопроверка. Открыть утилиту управления RAID-контроллером, проверить статус массива. Проанализировать SMART через утилиты производителя. Локализация причины между диском, контроллером, кабелем и драйвером выполняется в рамках аудита серверов.

🚩 Симптом. Последнее событие «Успешно» в журнале системы резервного копирования старше месяца. Остальные сессии завершаются статусами Failed, Warning, Skipped files. Тестовое восстановление не проводилось.
Критерий. Отсутствие успешного тестового восстановления за последние 30 дней.
Риск. Типовые причины отказа: смена учетных данных, нехватка места в репозитории, исключение виртуальных машин из задания. Без регулярных тестовых восстановлений компания не имеет подтверждения, что данные восстановимы.
Самопроверка. Выполнить тестовое восстановление одного файла или неиспользуемой виртуальной машины из последней цепочки. Если процесс завершается ошибкой – резервного копирования де-факто нет. Настройка расписаний, хранилищ, политик хранения и проверки восстановления – это резервное копирование данных.
Комментарий эксперта. «Наличие заданий резервного копирования и наличие резервных копий – разные вещи. При обследовании мы проверяем не факт запуска задания, а состав копий, место хранения, ошибки заданий и наличие проверки восстановления. Задание может отрабатывать годами, а в копию при этом не попадать критичная база». Александр Кудашкин, руководитель проектов внедрения СИНТО

🚩 Симптом. На корпусе сервера активен один индикатор блока питания, второй не горит или горит желтым либо красным. В консоли управления iLO, iDRAC или BMC – сообщение Power Supply Redundancy Lost.
Критерий. Статус резервирования питания отличается от Redundant или Full Redundancy.
Риск. Одиночный блок питания становится единой точкой отказа. Его выход из строя или скачок вводного напряжения останавливает сервер с риском повреждения файловых систем. Замена без остановки сервиса невозможна.
Самопроверка. Визуально проверить светодиоды блоков питания. В BMC-интерфейсе убедиться в статусе полного резервирования.

🚩 Симптом. На uplink-портах и портах ключевых серверов растут счетчики FCS/CRC errors, укороченных кадров (runts) и кадров-гигантов (giants). Пользователи эпизодически жалуются на замедление доступа и обрывы сессий.
Критерий. Рост счетчиков ошибок в реальном времени на ключевых портах.
Риск. Ошибки канального уровня указывают на физические дефекты среды передачи: поврежденный патч-корд, загрязненный оптический коннектор, электромагнитные наводки, неисправный трансивер. Повторные передачи снижают полезную пропускную способность и создают задержки, критичные для VoIP, 1С и видеоконференций.
Самопроверка. В интерфейсе управления коммутатором проанализировать счетчики ошибок на ключевых портах, зафиксировать динамику.
🚩 Симптом. В DHCP-листе или результатах сканирования присутствуют устройства с неизвестными именами и MAC-адресами, неучтенные точки доступа.
Критерий. Расхождение между перечнем активных узлов и инвентарной описью.
Риск. Неуправляемые устройства не проходят проверку соответствия политикам безопасности, не получают обновлений и часто сохраняют стандартные пароли. Они формируют неконтролируемый периметр в обход основных средств защиты.
Самопроверка. Просканировать диапазон локальной сети (nmap, Advanced IP Scanner). Сверить результат с инвентарной описью. Каждую незарегистрированную позицию идентифицировать и либо ввести в эксплуатацию легитимно, либо заблокировать.
🚩 Симптом. Невозможно оперативно определить путь трафика между сегментами. Схема коммутации отсутствует, кабельный журнал не ведется.
Критерий. Дежурный инженер без подготовки не может задокументировать маршрут от рабочей станции до ядра сети и сервера приложений.
Риск. Отсутствие актуальной CMDB и топологической документации напрямую увеличивает среднее время восстановления (MTTR). При инциденте диагностика затягивается, а ошибочное отключение неопознанного кабеля вызывает вторичный отказ. По стандартам ITSM это классифицируется как неприемлемый операционный риск.
Самопроверка. Поставить инженеру задачу проследить и зафиксировать полный маршрут. Если требуются устные пояснения «старожилов» – конфигурация неуправляема. Восстановление фактической топологии и паспорт сети – результат сетевого аудита.
Комментарий эксперта. «Отсутствие схемы сети – самый недооцененный риск. Оборудование можно заменить за день, а восстановление фактической топологии занимает существенно больше времени, потому что информация хранится в головах, а не в документах. Мы восстанавливаем схему связей между маршрутизаторами, коммутаторами, точками доступа и серверными сегментами и фиксируем единые точки отказа – это и есть первый управляемый актив компании». Александр Кудашкин, руководитель проектов внедрения СИНТО.
🚩 Симптом. Серверная операционная система или сетевое оборудование сняты с поддержки производителем. Обновления безопасности не выпускаются.
Критерий. Наличие в реестре активов позиций со статусом окончания жизненного цикла (EoL) или окончания поддержки (EoS) по официальным базам вендоров.
Риск. Известные уязвимости остаются незакрытыми. Дополнительно: выход оборудования из цикла продаж означает отсутствие запасных частей, из-за чего срок восстановления после поломки становится непрогнозируемым. Для систем в контуре регулирования эксплуатация неподдерживаемых компонентов создает вопросы к соответствию требованиям.
Самопроверка. Составить реестр аппаратных и программных компонентов, сверить с официальными базами жизненного цикла вендоров. Продление эксплуатации оборудования после окончания поддержки производителя – это обслуживание EOL-оборудования.
🚩 Симптом. В консоли централизованного управления агенты защиты отображаются серым значком, дата обновления баз превышает рекомендованный вендором интервал.
Критерий. Хосты с отставанием обновления сигнатур более нескольких суток или выпавшие из-под управления консоли.
Риск. Задержка обновления сигнатур повышает вероятность успешного заражения. Хост, выпавший из-под мониторинга, становится удобной целью для целевых атак и шифровальщиков.
Самопроверка. Проверить в единой консоли статусы всех агентов и временные метки последних обновлений. Полная проверка средств защиты, доступов и обновлений – аудит информационной безопасности.
🚩 Симптом. Повышенный шум вентиляторов, локальный перегрев в стойке.
Критерий. Температура входящего воздуха (inlet) стабильно выше 27°C. ASHRAE TC 9.9 определяет рекомендованный диапазон на входе оборудования 18–27°C для оборудования классов A. Допустимый диапазон для класса A1 шире – 15–32°C, но это условия сохранения работоспособности, а не условия длительной эксплуатации. Дополнительный признак – температура процессора под нагрузкой, приближающаяся к пороговым значениям, заданным производителем конкретной модели.
Риск. Длительная работа выше рекомендованного диапазона сокращает срок службы компонентов и вызывает троттлинг процессора – принудительное снижение производительности для защиты от теплового повреждения. Отказ единственного кондиционера без резерва приводит к лавинообразному росту температуры и аварийному отключению оборудования.
Самопроверка. Через BMC или IPMI проанализировать температурные тренды за месяц.

🚩 Симптом. Время формирования отчетов и обработки транзакций выросло в разы по сравнению с периодом внедрения. Нагрузочные испытания не проводились.
Критерий. Устойчивый рост средней задержки дисковой подсистемы и утилизации процессора на хостах виртуализации в часы пик относительно ранее зафиксированных значений. Практический ориентир по задержке для нагруженных дисковых подсистем – единицы миллисекунд; устойчивые значения в десятки миллисекунд требуют разбора. Точный порог зависит от типа накопителей и профиля нагрузки.
Риск. Рост очередей ввода-вывода и утилизации процессора приводит к деградации всех сервисов. Без нагрузочного тестирования точка отказа непрогнозируема, что дает внезапные остановки в пиковые периоды: конец месяца, квартала, сезонные пики.
Самопроверка. Измерить ключевые метрики в часы пиковой нагрузки и сравнить с зафиксированными ранее. Тренд на ухудшение без наращивания мощностей означает необходимость ребалансировки или модернизации.
Каждый индикатор из списка – не локальная неисправность, а симптом системного дисбаланса. Их накопление указывает на отсутствие единой стратегии управления ИТ-активами и отказоустойчивостью.
Закрывать в первую очередь стоит те флаги, где отказ ведет к невосстановимой потере данных: резервное копирование, резервирование питания, состояние дисковых массивов.
Следующий шаг – комплексный аудит ИТ-инфраструктуры: он показывает взаимосвязи между подсистемами и дает приоритизированный план работ.
Комментарий эксперта. «Разрозненная проверка отдельных систем не показывает причину. Замедление 1С может быть вызвано не сервером, а ошибками на портах коммутатора или перегрузкой дисковой подсистемы хранения. Причина видна только тогда, когда смотришь связи между подсистемами, а не каждую по отдельности». Александр Кудашкин, руководитель проектов внедрения СИНТО.
Достаточно ли самостоятельной проверки по чек-листу?
Чек-лист обнаруживает наиболее очевидные и критичные сигналы, но не заменяет инструментального обследования. Полная диагностика включает нагрузочное тестирование, анализ архитектуры, проверку соответствия требованиям безопасности и ревизию документации.
Как часто нужно проводить технический аудит ИТ-инфраструктуры?
Ориентир – один раз в год. При миграции, масштабировании или внедрении новых систем проводится внеплановое обследование.
Какие инструменты подходят для первичной самодиагностики?
Состояние дисков – утилиты производителя RAID-контроллера и SMART-мониторинг. Сеть – сканеры портов и анализаторы трафика (nmap, Wireshark). Температура – штатные интерфейсы BMC и IPMI. Интерпретация результатов требует квалификации.
Можно ли отложить аудит, если бюджета сейчас нет?
Минимально необходимо закрыть критические флаги: резервирование питания, работоспособность резервного копирования и компоненты со статусом EoL. Полное обследование планируется следующим шагом.
Чем комплексный аудит отличается от проверки отдельных систем?
Комплексный аудит исследует взаимосвязи и совокупную производительность подсистем и находит узкие места, невидимые при изолированной проверке. Проверка отдельного контура отвечает на вопрос о состоянии одной системы, комплексная – о причинах сбоя.
Сколько индикаторов считается критичным количеством?
Три и более одновременно присутствующих индикатора – основание для углубленного обследования инфраструктуры.
Автор: Александр Кудашкин, руководитель проектов внедрения СИНТО. Ведет проекты обследования и модернизации ИТ-инфраструктуры: серверы и виртуализация, сеть, резервное копирование.
ASHRAE, Technical Committee 9.9. Thermal Guidelines for Data Processing Environments – рекомендованный и допустимый диапазоны температуры на входе оборудования.
Microsoft Learn. Information about Event ID 51 – описание событий источника disk и порядок их интерпретации.
Официальные базы жизненного цикла производителей оборудования и программного обеспечения – статусы EoL и EoS.
Пороговые значения приведены как ориентиры. Для конкретного оборудования применяются спецификации производителя.