Облачные сервисы

Отказоустойчивость IaaS: как облако защищает бизнес от сбоев

Отказоустойчивость облачной инфраструктуры (IaaS) — это способность IT-системы продолжать работать даже при выходе из строя отдельных серверов, дисков или сетевого оборудования. Достигается это за счёт резервирования ресурсов, репликации данных и автоматического переключения нагрузки на исправные узлы — без остановки сервисов и потери информации для конечного пользователя.

Что вообще значит «отказоустойчивость» применительно к облаку?

Проще всего представить это через аналогию с многодвигательным самолётом. Если откажет один двигатель, машина не рухнет — оставшиеся возьмут нагрузку на себя, и полёт продолжится. Так же устроена надёжная облачная инфраструктура: ресурсы (серверы, диски, сети) заведомо избыточны, и отказ одного элемента не приводит к отказу всей системы. Пользователь сайта, интернет-магазина или 1С-сервиса просто не замечает, что «под капотом» что-то произошло.

Из-за чего вообще случаются сбои в облачной инфраструктуре?

Причин может быть много: выход из строя жёсткого диска или блока питания, обрыв сетевого кабеля, перегрузка оборудования, ошибка в настройках или банальное отключение электричества в дата-центре. Отдельная категория — человеческий фактор: неверная команда администратора или ошибка при обновлении софта. Хорошая инфраструктура проектируется с расчётом, что сбой — это не вопрос «если», а вопрос «когда», и заранее закладывает механизмы защиты.

Как облако защищается от отказа одного сервера?

Главный принцип — виртуализация и избыточность. Виртуальная машина клиента не привязана жёстко к одному физическому серверу: при необходимости она может быть перенесена на исправное оборудование почти незаметно для работы приложения. Диски, на которых хранятся данные, обычно объединяются в отказоустойчивые массивы — это давно известная и проверенная технология RAID, придуманная ещё в 1980-х годах в Калифорнийском университете в Беркли. Суть в том, что данные записываются сразу на несколько физических носителей, и выход из строя одного диска не приводит к их потере.

Что такое геораспределение и зачем нужны несколько дата-центров?

Даже самый надёжный дата-центр теоретически может столкнуться с проблемой — от аварии электросети до форс-мажора. Поэтому серьёзные провайдеры размещают инфраструктуру в нескольких физически разнесённых площадках и синхронизируют между ними данные. Если один дата-центр по каким-то причинам оказывается недоступен, нагрузка автоматически переключается на другой, и сервис продолжает работать. Для бизнеса это означает, что сайт, база данных или учётная система не «падают» из-за проблем в одной конкретной точке.

Клауд АйСи — облачная инфраструктура и защищённые серверы под 1С и цифровые сервисы бизнеса: размещение в дата-центре, резервное копирование и поддержка.
Всё в одном кабинете по подписке.
Есть бесплатные тарифы навсегда.

Чем отказоустойчивость отличается от резервного копирования?

Это два разных, но взаимодополняющих механизма защиты. Отказоустойчивость обеспечивает непрерывную работу системы прямо сейчас: если сервер отказал, нагрузку тут же подхватывает другой. Резервное копирование — это «страховка на крайний случай»: регулярные снимки данных, к которым можно вернуться, если что-то пошло совсем не так, например данные были случайно удалены или повреждены логически (а не физически). Грамотная инфраструктура всегда использует оба подхода одновременно, а не один вместо другого.

Что такое SLA и как понять, что провайдер надёжный?

SLA (соглашение об уровне обслуживания) — это документ, где провайдер прописывает конкретные обязательства: гарантированный процент доступности сервиса, время реакции на инцидент и порядок компенсации, если условия не выполнены. Наличие внятного SLA — хороший индикатор зрелости провайдера: он не боится брать на себя ответственность за качество инфраструктуры. Стоит также обращать внимание на то, как устроен мониторинг: чем быстрее система обнаруживает проблему, тем быстрее происходит переключение на резервные ресурсы.

Как бизнесу понять, что его облачная инфраструктура защищена достаточно?

Стоит задать провайдеру несколько простых вопросов: сколько дата-центров используется и насколько они физически разнесены, как организовано резервирование дисков и сети, как часто тестируются сценарии аварийного переключения и что входит в резервное копирование. Если ответы звучат конкретно и без общих фраз — это хороший знак. Полезно также заранее уточнить, что происходит с бизнесом в момент сбоя: полностью ли автоматизировано переключение или требуется вмешательство человека.

Как этот подход реализован в «Клауд АйСи»?

В «Клауд АйСи» инфраструктура для облачных серверов, 1С в облаке, баз данных и сайтов строится с учётом резервирования на уровне оборудования и регулярного резервного копирования данных. Это позволяет клиентам не думать о том, что произойдёт при аппаратном сбое, и сосредоточиться на своих задачах, а не на администрировании железа.

Разместите 1С и сервисы в облаке

Зарегистрируйтесь и подключите инфраструктуру под ваши задачи — начните с бесплатного тарифа.

Частые вопросы

Что такое отказоустойчивость облачной инфраструктуры простыми словами?

Это способность облака продолжать работать даже при выходе из строя отдельного сервера, диска или сети — за счёт резервных ресурсов, которые автоматически берут нагрузку на себя.

Отказоустойчивость и резервное копирование — это одно и то же?

Нет. Отказоустойчивость обеспечивает непрерывную работу системы здесь и сейчас, а резервное копирование позволяет восстановить данные, если они были повреждены или удалены.

Зачем облачным провайдерам несколько дата-центров?

Чтобы в случае проблем в одном дата-центре нагрузка автоматически переключалась на другой, и сервис оставался доступен для пользователей.

Что показывает SLA провайдера облачных услуг?

SLA фиксирует гарантированный уровень доступности сервиса, время реакции на инциденты и условия компенсации, если эти обязательства не выполняются.