Бесперебойность узла держится на трёх опорах: резервное питание, запасной канал связи и автоматический перезапуск службы после сбоя, и большинство простоев вызваны не поломкой сервера, а банальными причинами — отключением электричества, обрывом интернета и зависшим процессом, который никто не перезапустил. Каждая из этих причин закрывается недорого, если продумать решение заранее.

Аптайм — доля времени, в течение которого узел доступен и выполняет свою функцию; для валидатора он напрямую конвертируется в доход, потому что пропущенные слоты не вознаграждаются.

Откуда берутся простои

Статистика домашних узлов однообразна. Первое место занимает электропитание: короткое отключение на несколько секунд роняет сервер так же надёжно, как многочасовое, а второе — интернет-канал, где проблема чаще у провайдера, а не у оборудования. Третье место делят зависшие процессы и переполненный диск.

На арендованном сервере картина другая. Питание и канал закрывает дата-центр, зато добавляются перезагрузки гипервизора и работы провайдера по регламенту.

Схема из четырёх шагов: от резервного питания до автоперезапуска
Схема из четырёх шагов: от резервного питания до автоперезапуска

Сравнение мер резервирования

Мера От чего защищает и во что обходится
Источник бесперебойного питания Короткие отключения и просадки напряжения, стоимость невелика
Резервный канал через мобильную сеть Обрыв основного провайдера, нужен роутер с поддержкой переключения
Автоматический перезапуск службы Зависший процесс, настраивается штатными средствами системы
Второй сервер в холодном резерве Отказ основного узла, требует дисциплины при переключении

Питание: что выбрать

Для домашнего узла достаточно источника бесперебойного питания линейно-интерактивного типа с запасом мощности вдвое от потребления, при этом время автономной работы в десять-пятнадцать минут покрывает большинство коротких отключений. Обязательно настройте корректное завершение работы сервера по сигналу от источника: резкое обесточивание при активной записи повреждает базу данных узла, и восстановление занимает часы.

Связь и автоматика перезапуска

Резервный канал через мобильную сеть решает проблему обрыва у провайдера, причём роутер с автоматическим переключением делает это без вашего участия, и узел переживает аварию незаметно. Автоперезапуск службы настраивается штатным механизмом операционной системы: процесс поднимается сам после падения, не дожидаясь, пока вы заметите проблему и вмешаетесь вручную. Ограничьте частоту попыток, иначе система будет бесконечно поднимать заведомо нерабочую службу.

Где чаще всего ломается процесс

  • Источник питания без настроенного корректного завершения работы
  • Резервный канал, который никогда не проверяли в боевых условиях
  • Автоперезапуск без ограничения частоты: цикл падений и подъёмов
  • Заполненный диск, который останавливает узел без явного сбоя

Ко мне обращался читатель, у которого узел простоял двое суток после короткого отключения света, и источник бесперебойного питания отработал штатно, но сервер не был настроен на автозагрузку после подачи напряжения и остался выключенным. Проблема решилась одной галочкой в настройках материнской платы, о существовании которой он не знал.

Что делать при плановых работах

Обслуживание планируют на время с минимальной нагрузкой и предупреждают об этом систему мониторинга, чтобы не получать ложные оповещения, а для валидатора порядок строже: сначала убедитесь в полной остановке узла, и только потом запускайте его в другом месте. Одновременная работа двух экземпляров с одним ключом подписи расценивается сетью как нарушение.

Особенности арендованного сервера

В дата-центре питание и канал закрыты договором, но появляются свои риски, и провайдер вправе перезагрузить гипервизор для обновления, и виртуальный сервер уйдёт в перезапуск без вашего участия. Уточните регламент обслуживания и подпишитесь на уведомления о плановых работах.

Автозагрузка после перезапуска здесь так же важна, как дома, а служба узла должна подниматься автоматически при старте системы, иначе каждое обновление гипервизора превратится в простой до вашего вмешательства.

Проверка готовности к сбою

Резервирование, которое ни разу не проверяли, не работает, при этом раз в квартал имитируйте аварию: отключите основной канал и убедитесь, что резервный подхватил соединение, выдерните питание и проверьте корректное завершение работы. Такие учения занимают полчаса и выявляют проблемы до того, как они станут реальным простоем.

Смежные темы разобраны у нас. Вот основные. Общий раздел — майнинг и инфраструктура. Шире — статьи про криптокошельки. Запуск валидатора разбирает материал как запустить узел валидатора на арендованном сервере, а собственную точку доступа — статья как настроить собственную точку доступа к сети.

Вопросы и ответы

Какой аптайм считается нормальным?

Для валидатора ориентир — выше 99 процентов, что соответствует нескольким часам простоя в месяц, причём домашний узел с резервированием питания и канала обычно достигает этого уровня. Дата-центр даёт больше, но стоит дороже, и выбор зависит от размера залога: при небольшой сумме разница в доходе не окупит аренду.

Нужен ли второй сервер в резерве?

Для валидатора с заметным залогом — да, но держать его следует в холодном режиме, без ключа подписи, и горячий резерв с тем же ключом создаёт риск двойной подписи при сбое автоматики, а этот штраф дороже любого простоя. Переключение делают вручную после подтверждённой остановки основного узла.

Что делать при длительном отключении электричества?

Если автономии источника не хватает, корректно завершите работу узла и дождитесь восстановления питания, а попытки продлить работу генератором или дополнительными батареями оправданы только при крупном залоге. В остальных случаях несколько часов простоя обойдутся дешевле, чем повреждение базы данных при аварийном отключении.

Вердикт

Простои случаются из-за электричества, канала и зависших процессов, а не из-за сложных отказов железа, при этом все три причины закрываются недорогим источником питания, резервным каналом и автоперезапуском службы. Проверяйте резервирование учениями раз в квартал, иначе оно существует только на бумаге. И не забудьте про автозагрузку сервера после подачи напряжения — на ней спотыкаются чаще всего.

Требования сетей сверяйте напрямую. Руководство ethereum.org по самостоятельному стейкингу и сайт ФНС России дают технические требования и правила отчётности.

Иван Григорьев, автор Cryptium. Практикующий разбор майнинга и инфраструктуры. Больше материалов — в Telegram-канале t.me/cryptiumru.