Операции
Операционная готовность означает, что сеть может быть наблюдаема, изменена, резервирована и восстановлена без зависимости от импровизированного доступа к хостингам validator.
Наблюдаемость
- Включить профили телеметрии намеренно. Использовать
extendedпри необходимости/metricsиfullво время испытаний, требующих детальных маршрутов оператора Sumeragi. - Дашборд принимает пропускную способность, отказывается от пропускной способности, задерживает время выполнения заданий, глубину очереди, насыщающую очередь, просматривает изменения, оставляет консенсусные сообщения и давление на хранение.
- Сохраняйте снимки состояния, скрапы показателей, журналы и конфигурацию развертывания в одном и том же наборе инцидентов или эталонных артефактов.
- Предупреждение о продолжительном росте очередей, неожиданном пике отказов, задержанной высоте блоков, изменении взгляда и изменениях в здоровье сверстников.
См. Испособность и показатели .
Книги прохождения
- Напишите справочники для перезагрузки сверстников, деградации Torii, компромисса ключей, ошибок разрешений, исчерпания спонсоров платы, застрявших очередь и симптомов сетевого разделения.
- Включить точные проверки только для чтения перед написанием операций, особенно для регистрации сверстников, разрешений и изменений параметров.
- Сохраняйте правила экстренных контактов и эскалации за пределами repo-документов, если они включают в себя частные операционные данные
- Проверьте учебники после каждого инцидента, репетиции или значительного обновления.
См. Операционная безопасность .
Резервные копии и восстановление
- Резервное копирование сверстника в соответствии с пунктом восстановления, требуемым для развертывания.
- Сохраняйте подписанный генезис, высвободите метаданные, конфигурацию сверстников и записи хранения ключей, которые можно восстановить даже если хостинг-варидатор недоступен.
- Документируйте, восстанавливается ли процедура восстановления из генезиса, восстанавливается с моментального снимка или заменяет неудавшегося коллегию новой идентичностью.
- Никогда не проверяйте процедуры восстановления в первый раз во время производственного инцидента.
Управление изменениями
- Изменения конфигурации в цепочке следует рассматривать как транзакции, требующие проверки, предлетных чтений, авторизации и проверки после перемен.
- Внедрить обновления бинарных инструментов с планом совместимости и пунктом решений о возвращении.
- Избегайте изменения топологии сверстников, согласованного времени и рабочей нагрузки приложения в одном окне обслуживания, если это не требуется в плане миграции.
- Зарегистрируйте хэши транзакции и высоты блоков для операционных изменений.
См. Горячая перегрузка и Матрица совместимости .
Оценки потенциала
- Повторные проверки нагрузки при изменении количества валидаторов, аппаратного обеспечения, размещения сети, смеси рабочей нагрузкой или консенсусных параметров.
- Измерить нагрев, стабильное состояние и ожидаемую пиковую нагрузку вместо того, чтобы полагаться на короткий лучший случай пропускной способности образца.
- Сравните принятую пропускную способность с обязательной пропускной способностью и глубиной очереди. Если подаваемая TPS превышает обязательную TPS, а очереди растут, сеть переходит ее устойчивую рамку.