RTO (recovery time objective) означает допустимое время простоя системы после сбоя, а RPO (recovery point objective) означает допустимую потерю данных в часах. Система с RTO 4 часа и RPO 1 час должна снова работать в течение четырёх часов после инцидента, а потеряться может не больше последнего часа работы. Обе цифры задаёт бизнес отдельно для каждой системы, и вместе они определяют, сколько будут стоить резервное копирование и аварийное восстановление.
RTO и RPO на одном примере
Оптовая компания на 40 человек держит ERP на одном сервере, бэкап базы данных делается каждую ночь в 23:00. Во вторник в 15:00 выходит из строя дисковая система сервера.
- Потерянные данные: всё, что внесли после 23:00 понедельника, то есть 16 часов заказов и счетов. Случись сбой перед самыми 23:00, это были бы почти сутки. Значит, реальный RPO этой схемы 24 часа.
- Время простоя: час на подготовку замены, два часа на копирование и восстановление бэкапа 400 GB, ещё час на проверку базы и подключение пользователей. ERP снова работает в 19:00: RTO четыре часа, и то лишь если в этот день на работе человек, который знает порядок действий.
Если руководство хочет терять не больше часа заказов и снова работать через два часа, не выполнена ни одна цель. RPO в один час требует копий минимум раз в час, для базы данных обычно это бэкапы журнала транзакций каждые 15 минут. RTO в два часа обычно требует заранее установленного резервного сервера. Учтите, что отсчёт RTO начинается в момент сбоя, а не когда его заметили: сбой в 02:00, обнаруженный в 08:00, уже съел шесть часов.
RTO, RPO и срок хранения бэкапов
С первыми двумя часто путают третью цифру: как долго хранятся резервные копии.
| Цифра | На какой вопрос отвечает | От чего зависит | Пример |
|---|---|---|---|
| RPO | Сколько свежих данных можно потерять? | Как часто делаются копии и как быстро они покидают сервер | Копии каждый час: теряется до часа |
| RTO | Сколько можно простаивать? | Куда восстанавливать, сколько данных, насколько отработаны действия команды | Резервный сервер: меньше часа; новый сервер и полное восстановление: несколько часов |
| Срок хранения | Как далеко назад можно вернуться? | Сколько копий хранится и как долго | Ежедневные копии 7 дней: до недели назад |
Срок хранения важен, когда повреждение находят поздно. Программа-вымогатель часто днями сидит в сети, а пропажу удалённой папки могут не замечать неделями. Если копии хранятся 7 дней, а проблема началась 10 дней назад, она есть в каждой копии, каким бы хорошим ни был RPO. Храните ежедневные копии не меньше, чем проблемы обычно остаются незамеченными, плюс недельные или месячные копии.
Встретится и понятие максимально допустимого простоя (MTD): момента, после которого простой наносит бизнесу серьёзный ущерб. RTO должен быть с запасом ниже. Правила Кабинета министров Латвии № 397 требуют от субъектов NIS2 письменно задать RPO, RTO и максимально допустимый простой для каждой системы; подробнее в нашем чек-листе NIS2 для Латвии.
Как выбрать цели для каждой системы
- Составьте список систем и их зависимостей. ERP нужны ещё база данных, вход пользователей, DNS и VPN. Цепочка работает только тогда, когда восстановлено её самое медленное звено.
- Задайте бизнесу два вопроса по каждой системе. Сколько стоит час простоя в потерянных продажах, простаивающих сотрудниках и штрафах? Сколько стоит час потерянных данных, включая оплаченные онлайн заказы, которые нельзя воссоздать? Если 30 человек теряют половину рабочего времени, а час работы каждого стоит 30 EUR, час простоя обходится примерно в 450 EUR; см. наше сравнение стоимости сервера за 5 лет.
- Проверьте внешние требования. Договоры с вашими клиентами, NIS2, отраслевые правила и обязанности по хранению документов могут задать минимум за вас.
- Отнесите каждую систему к уровню и оцените цену. Если защита стоит в год больше, чем ущерб, который она предотвращает, ослабьте цель; если намного меньше, ужесточите.
- Запишите цели и проверьте их. Непроверенная цифра остаётся пожеланием.
Эти уровни служат отправной точкой для малой или средней компании, а не стандартом:
| Уровень | Типичные системы | RPO | RTO | Обычное решение |
|---|---|---|---|---|
| 1. Критичные | База ERP или бухгалтерии, оформление заказа в интернет-магазине, платежи | 15 минут или меньше | От 1 до 4 часов | Репликация или частые бэкапы журнала на подготовленный резервный сервер плюс обычные бэкапы |
| 2. Важные | Почта, файловый сервер, CRM, сайт компании | От 1 до 4 часов | В тот же рабочий день | Снапшоты или бэкапы каждый час, описанное восстановление на запасной сервер |
| 3. Обычные | Интранет, вики, серверы разработки и тестирования | 24 часа | От 1 до 3 рабочих дней | Ночной бэкап, который восстанавливают при необходимости |
| 4. Архив | Закрытые бухгалтерские годы, старые проекты, журналы для аудита | Неделя или одна копия, если ничего не меняется | От нескольких дней до недель | Еженедельные или разовые неизменяемые копии на недорогом хранилище |
Из чего складывается цена
- RPO определяет технологию. Ночные бэкапы дёшевы; снапшоты каждый час, передача журналов и непрерывная репликация добавляют трафик, место на хранилище и ещё одну систему, за которой нужно следить.
- RTO определяет, что вас ждёт. Восстановление на новое железо занимает часы или дни. Тёплый резерв, установленный и регулярно обновляемый, занимает от десятков минут до нескольких часов. Горячий резерв подхватывает работу автоматически за минуты, но примерно за двойную цену железа и лицензий.
- Объём данных определяет время восстановления. 2 TB по каналу 1 Gbit/s передаются на полной скорости примерно за четыре с половиной часа, ещё до всяких проверок.
- Срок хранения и неизменяемость требуют места. Копии, которые нельзя удалить до заданной даты, останавливают вымогателя, но и почистить их раньше срока нельзя.
- Лицензии и люди. Проверьте, что ваши лицензии разрешают на резервном сервере, и кто сможет провести восстановление в выходные.
Около нуля кривая становится крутой: снизить RPO с 24 часов до 1 часа обычно по карману, а с 1 часа почти до нуля часто уже нет.
Бэкап не равен аварийному восстановлению
Бэкап сохраняет копию данных. Аварийное восстановление (disaster recovery) включает план и инфраструктуру, которые возвращают сервис после серьёзного происшествия: куда восстанавливать, в каком порядке, кто принимает решение, как переключить пользователей и DNS и где лежат пароли, если менеджер паролей был на том самом сломанном сервере. Бэкапы дают RPO, аварийное восстановление даёт RTO.
RAID, репликацию и снапшоты часто принимают за бэкап. RAID переживает отказ одного диска, но не удаление или шифрование; репликация за секунды переносит и ошибки, и вымогателя; снапшоты на том же хранилище исчезают вместе с ним. Аварийное восстановление как услуга (DRaaS) упаковывает репликацию и резервную среду в подписку, и купленное или построенное своими силами, оно требует ответов на те же вопросы: какие системы, какие цели, где вторая площадка и как часто её проверяют.
Коротко о правиле 3-2-1
Храните три копии данных на двух разных системах или носителях, и одну из них вне офиса. Современная версия 3-2-1-1-0 добавляет одну офлайн или неизменяемую копию, которую вымогатель с паролями администратора не сможет удалить, и ноль ошибок в проверках восстановления. Подробнее в статьях правило 3-2-1 для данных бизнеса и как настроить резервное копирование сервера по правилу 3-2-1. Планируя RTO, помните: из внешней копии восстанавливаться обычно дольше всего, поэтому держите локальную копию для повседневных восстановлений, а внешнюю для аварий.
Проверяйте восстановление, иначе цифры останутся догадками
- Системы 1-го уровня восстанавливайте для проверки не реже раза в квартал, остальные не реже раза в год.
- Засекайте время, пока пользователи не смогут работать: это ваш настоящий RTO. Посмотрите на самую свежую восстановленную запись: это ваш настоящий RPO.
- Проверяйте всю цепочку: база открывается, приложение запускается, пользователь входит.
- Неудачный бэкап должен поднимать оповещение, которое читает человек, а удалить копии рабочими учётными данными должно быть невозможно.
- Запишите шаги так, чтобы по ним мог пройти другой человек, и раз в год отрабатывайте потерю основной площадки.
Что CloudHosting предлагает сегодня
У наших стандартных услуг параметры резервного копирования фиксированы. В терминах этой статьи:
- VPS: ежедневные бэкапы хранятся 7 дней отдельно от сервера и восстанавливаются из клиентской панели: RPO до 24 часов при сроке хранения 7 дней. Ежечасные снапшоты и копия в другом регионе, в Риге или Амстердаме, доступны по запросу, цену считаем под вашу конфигурацию.
- Хостинг сайтов: ежедневные бэкапы на отдельное хранилище и 14 дней точек восстановления; файл, базу данных или весь аккаунт можно восстановить из cPanel в любое время.
- Объектное хранилище S3: внешнее место для копий Veeam, rclone и других программ резервного копирования, в ЕС, с репликацией между несколькими независимыми дата-центрами и Object Lock для неизменяемых копий. От 10 TB, от 186.15 EUR в месяц.
- Выделенные серверы и размещение серверов: серверы настраиваете вы, поэтому схема резервного копирования ваша или та, которую мы спроектируем вместе с вами.
- Инфраструктура для компаний: RPO и RTO для каждой системы согласуем письменно, проектируем под них бэкапы, резервный сервер или пару с автоматическим переключением и проверяем восстановление вместе с вами.
Договорные цифры RTO и RPO согласуются в договоре отдельно для каждого проекта. Одной цифры для всех у нас нет, потому что честный RTO зависит от ваших систем, объёма данных и бюджета. 99.9% для стандартных услуг мы называем целью доступности, а не договорной гарантией. Готовую подписку DRaaS мы тоже не продаём: резервную среду проектируем в рамках инфраструктурного проекта.
У нашего дата-центра в Риге, который мы держим сами, питание N+1 с ИБП и дизель-генератором, охлаждение N+1 и два аплинка. Он охраняется и закрыт для посетителей: оборудование передают в нашем офисе, устанавливают его наши инженеры, и доступ есть только у ограниченного числа наших специалистов. Мониторинг и реагирование на инциденты работают 24/7, а инженеры отвечают в рабочие дни с 9:00 до 17:00 по рижскому времени. Чтобы бэкапы на ваших нынешних серверах кто-то вёл и проверял, есть наша IT-поддержка от 50 EUR в час или за фиксированную ежемесячную плату. Чтобы сначала понять, где вы находитесь, IT-аудит от 200 EUR включает проверку восстановления. Или пришлите список своих систем через страницу контактов.