[Docs] Armonización integral de bitácoras y protocolo ADN

This commit is contained in:
Ricardo Monla
2026-02-19 23:56:25 -03:00
parent 5b11dc167a
commit ca715aee69
37 changed files with 15223 additions and 235 deletions
+47
View File
@@ -0,0 +1,47 @@
# [PROC-01] - Backup de Nodos y VMs (Proxmox VE)
## 1. Identificación y Objetivo
- **ID**: `PROC-01`
- **Responsable**: Administrador del Grid
- **Objetivo**: Asegurar la integridad de todos los sistemas (físicos y virtuales) mediante backups periódicos en Proxmox, garantizando la alta disponibilidad tras el reinicio automático.
- **Frecuencia**: Semanal / Antes de cambios críticos.
## 2. Alcance y Prerrequisitos
- **Nodos Afectados**:
- Host Físicos: `srv-pmox1`, `srv-pmox2`, `srv-pmox3`.
- VMs/CTs: Todos los que inicien con `srvv-XXXX`.
- **Sistemas**: Linux (Host) y Universal (VM Guests).
- **Prerrequisitos**:
- [ ] Unidad de destino `zfsdisco1` operativa y montada.
- [ ] Espacio suficiente en `zfsdisco1`.
- [ ] Permisos de `Datastore.AllocateSpace` y `VM.Backup`.
## 3. Flujo de Tareas (Ejecución)
| Paso | Tarea | Estado | Notas |
| :--- | :--- | :---: | :--- |
| 1 | Ejecutar `scripts/mantenimiento_backups.rb` | 📍 | Automatiza el ciclo por VM (Ruby) |
| 2 | Limpieza Granular (Ciclo Interno) | ⏳ | Elimina backups > 6 días **por VM** |
| 3 | Backup Secuencial | ⏳ | Ejecuta `vzdump` tras limpiar cada VM |
| 4 | Identificar Nodos y VMs activas | ✅ | Filtrado por patrón `srvv-` y Linux |
| 5 | Verificar reinicio automático de servicios | ⏳ | Comprobar Uptime post-ciclo |
## 4. Verificación y Validación
- [ ] Tarea en Proxmox finalizada con estado `OK`.
- [ ] Archivos `.vma.zst` presentes en el storage de destino.
- [ ] Acceso SSH recuperado tras el reinicio automático.
- **Resultado Esperado**: ✅ Sistemas respaldados y servicios operativos (Uptime < 5 min desde el fin del backup).
## 5. Plan de Reversión (Hombre Muerto)
> [!IMPORTANT]
> Si una VM no inicia automáticamente tras el backup.
1. **Gatillo de Reversión**: VM en estado `stopped` por más de 10 minutos post-backup.
2. **Acciones**:
- Iniciar manualmente via CLI: `qm start <VMID>`.
- Revisar logs en `/var/log/pve/tasks/`.
- Si el disco está bloqueado: `qm unlock <VMID>`.
3. **Verificación post-reversión**: Confirmar ping a la IP del servicio afectado.
---
*Documento generado bajo el ADN del proyecto srv-ns8.*
+42
View File
@@ -0,0 +1,42 @@
# [PROC-XX] - [Título del Procedimiento]
## 1. Identificación y Objetivo
- **ID**: `PROC-XX`
- **Responsable**: Asistente/Usuario
- **Objetivo**: [Describir qué se busca lograr con este procedimiento]
- **Frecuencia**: [Manual / Automática / Bajo Demanda]
## 2. Alcance y Prerrequisitos
- **Nodos Afectados**: [Listado de hostnames, ej: srv-pmox1, srvv-sitio]
- **Sistemas**: [Linux / Windows / Docker]
- **Prerrequisitos**:
- [ ] Acceso Root/Sudo.
- [ ] Backup previo de datos críticos.
- [ ] [Herramienta necesaria] instalada.
## 3. Flujo de Tareas (Ejecución)
Este flujo debe seguirse secuencialmente. Utilizar iconos de estado según el `adn/02_protocolo.md`.
| Paso | Tarea | Estado | Notas |
| :--- | :--- | :---: | :--- |
| 1 | [Preparación inicial] | 📍 | |
| 2 | [Ejecución core] | ⏳ | |
| 3 | [Post-proceso] | ⏳ | |
## 4. Verificación y Validación
- [ ] [Prueba técnica 1]
- [ ] [Confirmación visual/logs]
- **Resultado Esperado**: ✅ [Descripción del estado de éxito]
## 5. Plan de Reversión (Hombre Muerto)
> [!IMPORTANT]
> En caso de fallo crítico o pérdida de conectividad, seguir estos pasos inmediatamente.
1. **Gatillo de Reversión**: [Ej: Error en el paso X, No hay respuesta tras 5 min]
2. **Acciones**:
- [Acción 1 para restaurar estado]
- [Acción 2 para restaurar estado]
3. **Verificación post-reversión**: [Confirmar retorno a la estabilidad]
---
*Documento generado bajo el ADN del proyecto srv-ns8.*