Alta disponibilidad: qué hace falta y cuánto cuesta cada nivel
En pocas palabras
Alta disponibilidad es diseñar un servicio para que la falla de una pieza (un disco, un servidor, un enlace) no lo deje fuera de línea. No se compra con un plan: se arma duplicando componentes y sumando algo que detecte la falla y pase la carga a la parte sana. Por eso el costo crece a saltos: el primer escalón serio ya implica pagar al menos dos servidores y el tiempo de alguien que mantenga la réplica. Para saber cuánta necesitás, compará lo que perdés en una hora de corte con lo que cuesta cada escalón.
Los nueves, traducidos a minutos de corte
Un porcentaje de disponibilidad es, en realidad, un permiso de corte. Esta tabla muestra cuánto tiempo fuera de servicio admite cada nivel:
| Disponibilidad | Por semana | Por mes de 30 días | Por año |
|---|---|---|---|
| 99 % | 1 h 41 min | 7 h 12 min | 3 días y 16 h |
| 99,5 % | 50 min | 3 h 36 min | 1 día y 20 h |
| 99,9 % | 10 min | 43 min | 8 h 46 min |
| 99,95 % | 5 min | 22 min | 4 h 23 min |
| 99,99 % | 1 min | 4 min 19 s | 53 min |
| 99,999 % | 6 s | 26 s | 5 min 15 s |
Un reinicio para aplicar una actualización del kernel ya se come el margen semanal de 99,99 %. A partir de ese nivel, ni el mantenimiento puede cortar el servicio.
Qué hay que agregar en cada escalón
| Escalón | Qué agregás | Qué cubre | Qué sigue sin cubrir |
|---|---|---|---|
| 1. Un servidor bien cuidado | Respaldo automático fuera del servidor, restauración probada y monitoreo con alertas | Perder datos o enterarte tarde | El tiempo que tardás en restaurar |
| 2. Redundancia dentro del equipo | Discos en RAID, fuentes duplicadas, alimentación con UPS y generador | La falla de un disco o un corte de luz | La falla del servidor completo |
| 3. Dos servidores | Réplica de la base de datos, archivos sincronizados y un mecanismo que pasa el tráfico al sano | La caída de un servidor | Un problema que afecte a todo el datacenter |
| 4. Dos sitios | Un segundo datacenter con réplica y un cambio de tráfico por DNS o por red | La pérdida de un sitio entero | Los errores de software o de operación, que se replican igual |
Cada escalón suma infraestructura y, sobre todo, horas de alguien que sepa mantenerlo andando.
Lo que ya resuelve la plataforma y lo que queda de tu lado
Parte de los primeros escalones viene incluida. En el datacenter de InHosting la energía está respaldada por UPS y generadores redundantes, y los servidores cloud tienen los discos en RAID 10 con uno de reserva: si un disco falla, el de repuesto entra en operación sin que el servidor se detenga. Si armás más de un servidor, se comunican por una red privada dentro del datacenter, que es por donde conviene que viaje la réplica.
El resto es diseño de tu equipo técnico: qué se replica, cómo se detecta la falla, quién o qué decide el cambio. InHosting pone dónde correrlo, con varios servidores aislados y un respaldo en otro nodo, y el esquema se evalúa en conjunto según el proyecto. El estado de la plataforma se publica en la página de estado del servicio, que un monitoreo externo comprueba cada 60 segundos.
La cuenta que decide el nivel
No hace falta saber cuánto cuesta un servidor para plantearla: alcanza con medir todo en meses de servidor. Supongamos que una hora sin sistema te cuesta, entre ventas perdidas y gente parada, lo mismo que un mes de servidor.
- De 99,5 % a 99,9 %: el máximo de corte anual baja de unas 44 horas a menos de 9. Son 35 horas que valen 35 meses de servidor, y el escalón, un segundo servidor con réplica, cuesta 12 meses de servidor por año más horas de administración. Conviene.
- De 99,9 % a 99,99 %: el margen baja de casi 9 horas a menos de una. Son 8 horas, que valen 8 meses de servidor. Llegar ahí pide cambio automático, un segundo sitio y alguien que lo pruebe seguido, y eso cuesta bastante más. Para esta empresa, no conviene.
- Repetí la cuenta con tu número. Si una hora te cuesta diez meses de servidor, el segundo escalón puede pasar a ser una buena inversión.
Para hacer la cuenta con tus números
Estos son los planes de servidor cloud con su precio final vigente. El escalón de dos servidores es, como mínimo, el doble de la línea que elijas.
| Plan | Incluye | Por mes |
|---|---|---|
| Servidor SH1 | 4 núcleos · 4 GB de RAM · RAID 10 | Sin stock |
| Servidor SH2 | 4 núcleos · 6 GB de RAM · RAID 10 | $ 87.458US$ 58,50 |
| Servidor SH3 | 4 núcleos · 8 GB de RAM · RAID 10 | $ 94.185US$ 63 |
| Servidor SH4 | 8 núcleos · 8 GB de RAM · RAID 10 | $ 100.913US$ 67,50 |
| Servidor SH5 | 8 núcleos · 16 GB de RAM · RAID 10 | $ 107.640US$ 72 |
| Servidor SH6 | 8 núcleos · 32 GB de RAM · RAID 10 | $ 114.368US$ 76,50 |
Con el 10 % de descuento del código INH, que ya va en los enlaces de contratación. Los precios se leen de la tienda. Ver el detalle de cada plan.
Cómo la redundancia mal armada provoca cortes
- Cerebro partido: si los dos nodos pierden contacto entre sí y cada uno cree que el otro murió, los dos atienden y escriben datos distintos. Por eso los clústeres serios usan un tercer voto, un árbitro que decide quién sigue.
- La réplica atrasada: si la copia va minutos detrás y la promovés, perdés esos minutos de datos. Hay que medir el atraso y saber cuánto aceptás.
- El cambio que nadie probó: la primera vez que se ejecuta de verdad no puede ser el día de la falla.
- El DNS con TTL largo: pasás el tráfico al servidor sano, pero los visitantes siguen yendo al caído durante horas.
- Las tareas programadas duplicadas: el mismo cron activo en los dos servidores manda dos veces los correos o procesa dos veces los pagos.
- Las dependencias compartidas: dos servidores detrás del mismo conmutador, o una aplicación que depende de una API externa sin redundancia.
Por dónde empezar si el presupuesto es chico
- Monitoreo externo con alertas que le lleguen a alguien que pueda actuar, también de noche.
- Respaldo automático fuera del servidor y una restauración completa de prueba, cronometrada. Ese tiempo es tu corte real ante una falla grave.
- Un procedimiento escrito, paso a paso, para reconstruir el servicio, que pueda seguir otra persona.
- TTL cortos en los registros DNS que cambiarías en una emergencia.
- Recién después, el segundo servidor.
Preguntas frecuentes
¿Alta disponibilidad y respaldo son lo mismo?
No. La alta disponibilidad mantiene el servicio andando cuando falla una pieza; el respaldo te devuelve los datos cuando algo los destruye. Si alguien borra una tabla por error, la réplica la borra también en el acto: solo el respaldo la trae de vuelta. Hacen falta los dos.
¿Con discos en RAID ya tengo alta disponibilidad?
Tenés redundancia en los discos, que es la falla de hardware más común. No cubre que se rompa otra pieza del servidor, que se cuelgue el sistema operativo o que una actualización deje la aplicación sin arrancar.
¿Alcanzan dos servidores en el mismo datacenter?
Cubren la caída de un servidor, que es lo que más pasa. Un evento que afecte a todo el edificio necesita un segundo sitio. Para la mayoría de las empresas, dos servidores en el mismo datacenter y un respaldo en otro lugar es un punto de equilibrio razonable.
¿Cómo mido la disponibilidad que tuve de verdad?
Con un monitoreo que consulte el servicio desde afuera cada pocos segundos o minutos y guarde el historial. El número depende de qué se mide y de cómo se cuentan los mantenimientos: está explicado en cómo se calcula el uptime.
Seguí leyendo
Cómo se calcula el uptime y cuánto corte permite cada porcentaje
La fórmula del uptime, cuántos minutos de corte admite el 99,9 % o el 99,99 %, cómo se combinan varios servicios y qué mirar en una medición o un contrato.
6 min de lectura
Servidor cloud, híbrido o dedicado: qué recibís con cada nombre
Los nombres se mezclan. Qué hay detrás de un servidor cloud, uno híbrido y uno dedicado, cómo detectar la sobreventa y cuál conviene según tu carga.
5 min de lectura
Plan de continuidad para una PyME: una página que sí se usa
Cómo armar un plan de continuidad chico y útil: qué sistemas son críticos, cuánto pueden estar caídos, cuántos datos podés perder y quién hace qué.
6 min de lectura
