48 lines
2.1 KiB
Markdown
48 lines
2.1 KiB
Markdown
# [PROC-01] - Backup de Nodos y VMs (Proxmox VE)
|
|
|
|
## 1. Identificación y Objetivo
|
|
- **ID**: `PROC-01`
|
|
- **Responsable**: Administrador del Grid
|
|
- **Objetivo**: Asegurar la integridad de todos los sistemas (físicos y virtuales) mediante backups periódicos en Proxmox, garantizando la alta disponibilidad tras el reinicio automático.
|
|
- **Frecuencia**: Semanal / Antes de cambios críticos.
|
|
|
|
## 2. Alcance y Prerrequisitos
|
|
- **Nodos Afectados**:
|
|
- Host Físicos: `srv-pmox1`, `srv-pmox2`, `srv-pmox3`.
|
|
- VMs/CTs: Todos los que inicien con `srvv-XXXX`.
|
|
- **Sistemas**: Linux (Host) y Universal (VM Guests).
|
|
- **Prerrequisitos**:
|
|
- [ ] Unidad de destino `zfsdisco1` operativa y montada.
|
|
- [ ] Espacio suficiente en `zfsdisco1`.
|
|
- [ ] Permisos de `Datastore.AllocateSpace` y `VM.Backup`.
|
|
|
|
## 3. Flujo de Tareas (Ejecución)
|
|
|
|
| Paso | Tarea | Estado | Notas |
|
|
| :--- | :--- | :---: | :--- |
|
|
| 1 | Ejecutar `scripts/mantenimiento_backups.rb` | 📍 | Automatiza el ciclo por VM (Ruby) |
|
|
| 2 | Limpieza Granular (Ciclo Interno) | ⏳ | Elimina backups > 6 días **por VM** |
|
|
| 3 | Backup Secuencial | ⏳ | Ejecuta `vzdump` tras limpiar cada VM |
|
|
| 4 | Identificar Nodos y VMs activas | ✅ | Filtrado por patrón `srvv-` y Linux |
|
|
| 5 | Verificar reinicio automático de servicios | ⏳ | Comprobar Uptime post-ciclo |
|
|
|
|
## 4. Verificación y Validación
|
|
- [ ] Tarea en Proxmox finalizada con estado `OK`.
|
|
- [ ] Archivos `.vma.zst` presentes en el storage de destino.
|
|
- [ ] Acceso SSH recuperado tras el reinicio automático.
|
|
- **Resultado Esperado**: ✅ Sistemas respaldados y servicios operativos (Uptime < 5 min desde el fin del backup).
|
|
|
|
## 5. Plan de Reversión (Hombre Muerto)
|
|
> [!IMPORTANT]
|
|
> Si una VM no inicia automáticamente tras el backup.
|
|
|
|
1. **Gatillo de Reversión**: VM en estado `stopped` por más de 10 minutos post-backup.
|
|
2. **Acciones**:
|
|
- Iniciar manualmente via CLI: `qm start <VMID>`.
|
|
- Revisar logs en `/var/log/pve/tasks/`.
|
|
- Si el disco está bloqueado: `qm unlock <VMID>`.
|
|
3. **Verificación post-reversión**: Confirmar ping a la IP del servicio afectado.
|
|
|
|
---
|
|
*Documento generado bajo el ADN del proyecto srv-ns8.*
|