Objetivo y alcance
Evitar que alta disponibilidad nominal dependa de recursos, redes o almacenamiento con puntos únicos de falla.
Contexto técnico
Un clúster coordina nodos y habilita gestión conjunta, pero alta disponibilidad requiere quórum, capacidad de reserva y almacenamiento adecuado. Tres nodos pequeños no garantizan continuidad si no pueden absorber cargas.
Corosync, migración, almacenamiento, gestión y tráfico de máquinas tienen necesidades distintas. El diseño debe contemplar mantenimiento y fallas simultáneas razonables.
Arquitectura y criterios
- Diseñar quórum y testigos según cantidad y ubicación.
- Separar redes críticas y validar latencia.
- Reservar capacidad para pérdida de un nodo.
- Elegir almacenamiento según consistencia y recuperación.
- Mantener backup independiente del clúster.
Implementación recomendada
- Perfilar cargas, crecimiento y criticidad.
- Diseñar nodos, red, almacenamiento y energía.
- Construir piloto y medir migración y fallas.
- Configurar HA sólo para cargas con procedimiento validado.
- Documentar operación, actualización y recuperación.
Riesgos y controles
- Ceph sin discos, red o nodos suficientes degrada rendimiento y resiliencia.
- Sobreasignar memoria impide evacuar un nodo.
- El clúster no protege contra borrado o corrupción lógica.
Validación y evidencia
- Las cargas prioritarias reinician o migran según objetivo.
- La pérdida de un nodo conserva quórum y capacidad.
- Backups se restauran fuera del clúster original.
Operación continua
Monitorear quórum, latencia, almacenamiento, capacidad y estado de backups. Actualizaciones y mantenimiento deben respetar capacidad de reserva.
Próximo paso
Construir un modelo de capacidad N+1 y validar con métricas de las cargas actuales antes de seleccionar hardware.