Кластеры высокой готовности
«ИНЛАЙН ГРУП» имеет большой опыт по реализации кластеров высокой готовности на продуктах Microsoft, VMware и HPE (Serviceguard).
В каждой компании все ИТ-сервисы разделены на категории по степени их влияния непосредственно на бизнес, и длительный простой высококритичных ИТ-сервисов может существенно повлиять на финансовое состояние компании. Кластер высокой готовности позволяет обеспечить нормальное функционирование ИТ-сервисов и приложений компании с заданными характеристиками. При этом в рамках кластера поддерживается легкость управления централизованно всем кластером, отдельными узлами и сервисами, развернутыми на нем.
Мы поможем создать кластер высокой готовности для обеспечения нормального функционирования ИТ-сервисов и в этом решении будет заложена защита от всех обозначенных угроз, которые могут стать причиной возникновения сбоев.
Кластер высокой готовности — это группа серверов, работающих как единая система для предоставления высокой доступности ИТ-сервисов и приложений. Кластер характеризуется высокой надежностью, производительностью и гибким масштабированием. Высокая надежность достигается применением отказоустойчивых и катастрофоустойчивых решенийКатастрофоустойчивость сервисов и приложений. Производительность и масштабируемость — распределением нагрузки между узлами кластера.
Проектирование кластера высокой готовности начинается с определения характеристик его функционирования. Прежде всего, это показатели RPO/RTO, но могут быть и другие важные для заказчика параметры, определяющие режим работы кластера.
Работоспособность ИТ-сервиса может быть нарушена по следующим причинам:
- разрушение данных;
- аппаратная неисправность, которая может привести к недоступности приложений;
- ошибка в приложении — ошибка программиста в уже протестированном и запущенном в производство приложении может и не проявиться, но если все же такой инцидент имеет место, то он приводит к непосредственной остановке нормального функционирования ИТ-сервиса;
- человеческая ошибка, например, ошибка администратора;
- плановое обслуживание: замена компонентов, установка пакетов обновлений, перезагрузка — одни из наиболее частых причин недоступности сервисов;
- общие проблемы в ЦОД — пропадание электропитания может привести к недоступности всего ЦОД.
При проектировании кластера для каждого такого риска предусматривается какое-либо действие, направленное на продолжение нормального функционирования ИТ-сервиса, например:
- мониторинг доступности ИТ-сервисов и отдельных процессов;
- перезапуск ИТ-сервиса на том же или другом сервере по определенному ответу от системы мониторинга;
- периодическое создание «снимков» данных средствами дискового массива, использующего интеграцию с ИТ-сервисами;
- резервное копирование данных согласно разработанному расписанию;
- поддержание на удаленной площадке полной копии данных и приложений ИТ-сервиса в актуальном состоянии для перезапуска ИТ-сервиса.
При этом может потребоваться интеграция с системой резервного копированияСистемы резервного копирования, системами хранения данныхСистемы и сети хранение данных и другими решениями. После проработки всех возможных вариантов отказов и проверки, что все показатели RPO/RTO выполняются, можно приступать к настройке кластера и его тестированию.
Ознакомьтесь с другими решениями и услугами, предоставляемыми «ИНЛАЙН ГРУП» в рамках направления.