Настройка автоматического восстановления сайта из бэкапа
Сервер упал, база данных потеряна, а последний бэкап — недельной давности. Если вы не тестировали восстановление заранее, каждый час простоя обходится в $500–$1000 упущенной выручки для среднего интернет-магазина. Мы решаем эту проблему: разрабатываем скрипты и процедуры, которые гарантируют RTO (Recovery Time Objective) не более 1 часа для любого веб-проекта. В этой статье — реальный кейс автоматизации восстановления PostgreSQL и файлов.
Восстановление из бэкапа — процесс, который часто откладывают до последнего момента. Однако когда наступает реальный инцидент, каждая минута на счету. Ручные операции по поднятию дампа, настройке прав и перенаправлению трафика приводят к хаосу и ошибкам. Мы автоматизируем весь цикл, от обнаружения сбоя до полного возврата сайта в работу. Более 5 лет практики в disaster recovery и 40+ успешных внедрений для e-commerce и медиа-проектов подтверждают: автоматизация — единственный способ гарантировать предсказуемое время восстановления.
Реальные проблемы восстановления из бэкапа
Многие компании хранят бэкапы, но никогда не проверяют, как их разворачивать. Типичные узкие места:
- Отсутствие документации: дежурный инженер в панике ищет, где лежат дампы и какие пароли.
- Медленный restore: восстановление PostgreSQL через pg_restore может занять часы, если база большая.
- Ошибки совместимости версий: дамп сделан на старой версии PostgreSQL, а новая не принимает.
- Потеря инкрементных бэкапов: цепочка бэкапов прерывается, и восстановить можно только до момента сбоя.
Мы сталкивались с каждым из этих сценариев. Решение — автоматизированный pipeline с проверкой целостности и ежемесячными drill-тестами.
Как автоматизировать восстановление PostgreSQL?
Мы используем bash-скрипты для восстановления БД и файлов, а также git для кода. Основной стек: PostgreSQL 15, Nginx, PHP 8.3, AWS S3 для хранения бэкапов. Архитектура скриптов учитывает типичные ошибки и автоматически проверяет целостность данных.
Скрипт восстановления PostgreSQL
#!/bin/bash # /usr/local/bin/restore-db.sh # Использование: restore-db.sh [backup-file|latest] [target-database] set -euo pipefail BACKUP_SOURCE="${1:-latest}" TARGET_DB="${2:-myapp_restore}" S3_BUCKET="s3://myapp-backups/postgresql" LOCAL_BACKUP_DIR="/var/backups/postgresql" echo "[$(date)] Starting database restore" echo " Source: $BACKUP_SOURCE" echo " Target: $TARGET_DB" # Найти файл backup if [ "$BACKUP_SOURCE" = "latest" ]; then BACKUP_FILE=$(aws s3 ls "${S3_BUCKET}/" | sort | tail -1 | awk '{print $4}') echo " Latest backup: $BACKUP_FILE" # Скачать aws s3 cp "${S3_BUCKET}/${BACKUP_FILE}" "/tmp/${BACKUP_FILE}" LOCAL_FILE="/tmp/${BACKUP_FILE}" else LOCAL_FILE="$BACKUP_SOURCE" fi # Проверить файл if [ ! -f "$LOCAL_FILE" ]; then echo "ERROR: Backup file not found: $LOCAL_FILE" exit 1 fi # Создать целевую БД (если не существует) psql -U postgres -c "CREATE DATABASE ${TARGET_DB};" 2>/dev/null || true # Очистить существующие данные psql -U postgres -c " DROP DATABASE IF EXISTS ${TARGET_DB}_old; ALTER DATABASE ${TARGET_DB} RENAME TO ${TARGET_DB}_old; CREATE DATABASE ${TARGET_DB}; " 2>/dev/null || true # Восстановить echo "[$(date)] Restoring database..." gunzip -c "$LOCAL_FILE" | psql -U postgres -d "$TARGET_DB" -v ON_ERROR_STOP=1 # Проверить TABLES=$(psql -U postgres -d "$TARGET_DB" -t -c "SELECT COUNT(*) FROM information_schema.tables WHERE table_schema = 'public';") echo "[$(date)] Restore completed. Tables restored: $TABLES" # Очистить rm -f "$LOCAL_FILE" psql -U postgres -c "DROP DATABASE IF EXISTS ${TARGET_DB}_old;" 2>/dev/null || true echo "[$(date)] Database restore finished successfully" Пояснение: скрипт ищет последний бэкап в S3, скачивает, создаёт целевую БД, восстанавливает через gunzip+psql, проверяет количество таблиц и очищает временные файлы. Всё с логами и обработкой ошибок (set -euo pipefail).
Полное восстановление сайта
#!/bin/bash # /usr/local/bin/restore-site.sh # Полное восстановление: БД + файлы + код DOMAIN="example.com" APP_DIR="/var/www/myapp" GIT_REPO="[email protected]:company/myapp.git" GIT_TAG="${1:-main}" echo "=== Site Recovery Started ===" echo "Domain: $DOMAIN" echo "Deploying: $GIT_TAG" # 1. Включить maintenance page cat > /var/www/maintenance/index.html << 'EOF' <!DOCTYPE html> <html><body> <h1>Технические работы</h1> <p>Сайт временно недоступен. Восстановление займёт не более 60 минут.</p> </body></html> EOF # Nginx: перенаправить на maintenance nginx -s reload # 2. Восстановить код из git if [ -d "$APP_DIR" ]; then mv "$APP_DIR" "${APP_DIR}.bak.$(date +%s)" fi git clone --branch "$GIT_TAG" "$GIT_REPO" "$APP_DIR" cd "$APP_DIR" composer install --no-dev --optimize-autoloader cp .env.production .env # 3. Восстановить БД /usr/local/bin/restore-db.sh latest myapp # 4. Восстановить файлы aws s3 sync s3://myapp-backups/files/uploads/ \ "${APP_DIR}/storage/app/uploads/" # 5. Права и кэш chown -R www-data:www-data "$APP_DIR/storage" "$APP_DIR/bootstrap/cache" php artisan config:cache php artisan route:cache php artisan view:cache php artisan migrate --force # 6. Убрать maintenance, проверить # Восстановить основной nginx конфиг nginx -s reload # Базовая проверка HTTP_CODE=$(curl -s -o /dev/null -w "%{http_code}" "https://${DOMAIN}/health") if [ "$HTTP_CODE" = "200" ]; then echo "=== Recovery SUCCESSFUL: HTTP $HTTP_CODE ===" else echo "=== Recovery FAILED: HTTP $HTTP_CODE ===" exit 1 fi Этот скрипт автоматизирует развёртывание кода из git, восстановление БД, синхронизацию файлов, настройку кэша и переключение из режима обслуживания. Всё в одном вызове: restore-site.sh v1.2.3.
Как мы тестируем восстановление?
Автоматически. Каждый месяц в 8 утра 1-го числа cron запускает restore-site.sh в тестовую среду. Если восстановление завершилось успешно (HTTP 200), отправляется heartbeat в healthchecks.io. Если нет — мы получаем алерт и исправляем скрипт до того, как случится реальный инцидент. Такой подход позволил нашим клиентам сэкономить до $20,000 в год на потенциальных простоях.
Дополнительные инструменты для DR
Помимо S3, используем rsync для инкрементных бэкапов файлов и pg_dump с сжатием для баз данных. Для мониторинга целостности — хэши SHA-256. В runbook включаем команды для быстрой замены инстанса и переключения DNS. Закажите аудит вашей схемы — это бесплатно и поможет выявить узкие места.
Пример runbook
1. Скачать последний бэкап из S3. 2. Развернуть код из git. 3. Восстановить БД с проверкой целостности. 4. Синхронизировать файлы. 5. Обновить конфигурацию Nginx. 6. Проверить health endpoint.Сравнение методов резервного копирования
| Метод | Скорость восстановления | Стоимость хранения | Надёжность |
|---|---|---|---|
| S3 + версионирование | Быстро | Средняя | Высокая |
| Rsync + инкремент | Средне | Низкая | Средняя |
| Локальные дампы | Медленно | Очень низкая | Низкая |
Процесс работы
- Аналитика: аудит текущей схемы бэкапов, определение RTO/RPO.
- Проектирование: выбор инструментов (S3, rsync, pg_dump), архитектура скриптов.
- Реализация: написание restore-скриптов, настройка системы оповещения.
- Тестирование: полный drill с часами и проверкой целостности данных.
- Документирование: runbook для дежурного, чек-лист для post-mortem.
- Передача: обучение команды, передача доступов и исходников.
Что входит в работу
- Скрипты восстановления БД и файлов (github-репозиторий).
- Runbook на русском языке для дежурного.
- Ежемесячный автоматический drill через cron + healthchecks.
- Консультация по оптимизации RTO/RPO.
- Гарантия: если восстановление не укладывается в оговорённое время — мы дорабатываем бесплатно.
Более 5 лет опыта и 40+ внедрений для e-commerce и медиа-проектов говорят сами за себя. Получите консультацию инженера — это бесплатно.
Сроки и стоимость
Настройка полного цикла автоматического восстановления занимает от 3 до 5 рабочих дней в зависимости от сложности проекта. Точную стоимость рассчитываем после аудита.
Хотите такую же надёжность? Напишите нам — оценим ваш проект за один день.







