Skip to content

Операции

Операционная готовность означает, что сеть может быть наблюдаема, изменена, резервирована и восстановлена без зависимости от импровизированного доступа к хостингам validator.

Наблюдаемость

  • Включить профили телеметрии намеренно. Использовать extended при необходимости /metrics и full во время испытаний, требующих детальных маршрутов оператора Sumeragi.
  • Дашборд принимает пропускную способность, отказывается от пропускной способности, задерживает время выполнения заданий, глубину очереди, насыщающую очередь, просматривает изменения, оставляет консенсусные сообщения и давление на хранение.
  • Сохраняйте снимки состояния, скрапы показателей, журналы и конфигурацию развертывания в одном и том же наборе инцидентов или эталонных артефактов.
  • Предупреждение о продолжительном росте очередей, неожиданном пике отказов, задержанной высоте блоков, изменении взгляда и изменениях в здоровье сверстников.

См. Испособность и показатели .

Книги прохождения

  • Напишите справочники для перезагрузки сверстников, деградации Torii, компромисса ключей, ошибок разрешений, исчерпания спонсоров платы, застрявших очередь и симптомов сетевого разделения.
  • Включить точные проверки только для чтения перед написанием операций, особенно для регистрации сверстников, разрешений и изменений параметров.
  • Сохраняйте правила экстренных контактов и эскалации за пределами repo-документов, если они включают в себя частные операционные данные
  • Проверьте учебники после каждого инцидента, репетиции или значительного обновления.

См. Операционная безопасность .

Резервные копии и восстановление

  • Резервное копирование сверстника в соответствии с пунктом восстановления, требуемым для развертывания.
  • Сохраняйте подписанный генезис, высвободите метаданные, конфигурацию сверстников и записи хранения ключей, которые можно восстановить даже если хостинг-варидатор недоступен.
  • Документируйте, восстанавливается ли процедура восстановления из генезиса, восстанавливается с моментального снимка или заменяет неудавшегося коллегию новой идентичностью.
  • Никогда не проверяйте процедуры восстановления в первый раз во время производственного инцидента.

Управление изменениями

  • Изменения конфигурации в цепочке следует рассматривать как транзакции, требующие проверки, предлетных чтений, авторизации и проверки после перемен.
  • Внедрить обновления бинарных инструментов с планом совместимости и пунктом решений о возвращении.
  • Избегайте изменения топологии сверстников, согласованного времени и рабочей нагрузки приложения в одном окне обслуживания, если это не требуется в плане миграции.
  • Зарегистрируйте хэши транзакции и высоты блоков для операционных изменений.

См. Горячая перегрузка и Матрица совместимости .

Оценки потенциала

  • Повторные проверки нагрузки при изменении количества валидаторов, аппаратного обеспечения, размещения сети, смеси рабочей нагрузкой или консенсусных параметров.
  • Измерить нагрев, стабильное состояние и ожидаемую пиковую нагрузку вместо того, чтобы полагаться на короткий лучший случай пропускной способности образца.
  • Сравните принятую пропускную способность с обязательной пропускной способностью и глубиной очереди. Если подаваемая TPS превышает обязательную TPS, а очереди растут, сеть переходит ее устойчивую рамку.