Периодические самопроизвольные перезагрузки серверного оборудования — одна из самых сложных для диагностики проблем, поскольку сервер большую часть времени работает нормально, а сбой проявляется непредсказуемо, часто без возможности длительной остановки для полноценной диагностики.
Первое, что стоит проверить по логам — коррелируют ли перезагрузки с определённой нагрузкой на сервер (пиковые часы использования, конкретные задачи) или происходят хаотично независимо от загрузки. Корреляция с нагрузкой указывает на проблему термостабильности или нестабильность VRM-модуля материнской платы под высокой нагрузкой.
Вторая проверка — температурные логи компонентов сервера на момент перезагрузки, если такая телеметрия доступна через BMC/IPMI. Резкий скачок температуры непосредственно перед перезагрузкой указывает на проблему охлаждения — забитые пылью радиаторы, неисправные вентиляторы или деградацию термопасты процессора.
Третья вероятная причина — нестабильность блока питания при определённых уровнях нагрузки, что можно косвенно проверить через логи напряжений, если платформа их фиксирует. Незначительные, но систематические отклонения напряжения по линиям питания процессора или памяти — частый источник таких проблем.
Четвёртая причина, которую стоит рассмотреть при отсутствии явной корреляции с нагрузкой или температурой — деградация конкретных компонентов материнской платы, которые проявляют нестабильность хаотично, без чёткой закономерности.
Для диагностики без остановки продакшена разумно начинать с анализа доступных логов и телеметрии, прежде чем переходить к физическому вскрытию и тестированию сервера — это позволяет сузить круг вероятных причин и спланировать окно для более глубокой диагностики заранее, а не в экстренном порядке.