Capítulo 23 · Prueba digital, resiliencia e inteligencia artificial

Continuidad, Recuperación, Resiliencia Operacional e Infraestructuras Críticas

Diseñar capacidades para mantener o recuperar servicios esenciales ante fallos, incidentes cibernéticos y crisis, incluyendo entornos regulados e infraestructuras críticas.

Continuidad de negocio y resiliencia

Continuidad de negocio y recuperación tecnológica están relacionadas, pero responden a preguntas diferentes. La continuidad estudia cómo mantener funciones esenciales durante una interrupción; la recuperación tecnológica busca restaurar sistemas y datos. Un servicio puede seguir funcionando de manera reducida mediante procesos alternativos mientras se recupera infraestructura. La resiliencia incorpora capacidad de anticipar, resistir y adaptarse al fallo. Para diseñarla se identifican dependencias tecnológicas, humanas y externas. Una organización con copias perfectas puede carecer de continuidad si pierde conectividad, personal clave o autorizaciones necesarias para reiniciar el servicio.

Conceptos de este apartado

  • Continuidad vs disaster recovery
  • Procesos críticos
  • Dependencias tecnológicas y humanas
  • Escenarios disruptivos
  • Gobernanza de continuidad
  • Ciclo de mejora

Business Impact Analysis

El análisis de impacto en el negocio o BIA permite identificar procesos críticos y consecuencias de su interrupción a lo largo del tiempo. El objetivo de tiempo de recuperación (RTO) indica cuándo se pretende restablecer un servicio; el objetivo de punto de recuperación (RPO) expresa cuánta información reciente puede perderse temporalmente. Ninguno de ellos es una garantía automática ni una cifra universal. Deben justificarse mediante necesidades reales y probarse. Los límites máximos de interrupción tolerable ayudan a priorizar recursos. Un hospital y una biblioteca pública pueden tener necesidades distintas, aunque utilicen soluciones informáticas similares.

Conceptos de este apartado

  • Identificación de procesos
  • Impactos en el tiempo
  • MTPD/MAO
  • RTO y RPO
  • Dependencias internas y externas
  • Priorización de recuperación

Estrategias de recuperación

Existen diferentes estrategias de recuperación: copias de seguridad, replicación, redundancia y sitios alternativos. La replicación mejora disponibilidad ante ciertas fallas, pero también puede replicar errores o borrados maliciosos. Una copia inmutable dificulta modificaciones durante el período protegido, aunque requiere comprobar acceso, integridad y posibilidad de restauración. En cloud es importante conocer costes, dependencias de proveedor y mecanismos de recuperación. Los procedimientos manuales de contingencia permiten sostener operaciones esenciales cuando no hay sistemas disponibles. Elegir estrategia implica equilibrar tiempos, impacto, seguridad y recursos reales.

Conceptos de este apartado

  • Backups y copias inmutables
  • Replicación y redundancia
  • Sitios alternativos
  • Recuperación cloud
  • Procedimientos manuales de contingencia
  • Gestión de capacidad durante degradación

Resiliencia frente a ransomware

Frente a ransomware, recuperar no significa simplemente encender una copia de seguridad. Hay que determinar si el entorno conserva persistencia maliciosa, si las identidades y claves siguen comprometidas y si los datos restaurados son íntegros. Separar privilegios de administración de respaldos reduce el riesgo de que un mismo compromiso destruya producción y copias. Las imágenes base verificadas, o golden images, ayudan a reconstruir entornos confiables. La recuperación debe seguir un orden basado en servicios críticos y dependencias. Volver demasiado pronto puede restaurar también la debilidad que permitió el incidente.

Conceptos de este apartado

  • Separación de backups
  • Privilegios en plataformas de backup
  • Golden images
  • Recuperación limpia
  • Validación de integridad
  • Prioridad de servicios y secuencia de restauración

Infraestructuras críticas y OT

Las tecnologías operativas u OT controlan procesos físicos en industrias, hospitales e infraestructuras críticas. Sistemas ICS y SCADA pueden tener requisitos de disponibilidad y seguridad física distintos de las oficinas tradicionales. Una intervención que resulta aceptable en un servidor de pruebas puede ser peligrosa para un proceso industrial activo. Las ventanas de mantenimiento, los equipos antiguos y las conexiones remotas exigen medidas específicas. La segmentación puede limitar propagación y la coordinación con personal de operación es indispensable. Evaluar ciberseguridad de OT implica considerar consecuencias materiales y humanas, no solo confidencialidad de datos.

Conceptos de este apartado

  • Conceptos IT/OT
  • ICS/SCADA
  • Disponibilidad y seguridad física
  • Segmentación y acceso remoto
  • Ventanas de mantenimiento y legado
  • Impacto social y sectorial de interrupciones

Pruebas y ejercicios

Los planes de continuidad deben comprobarse mediante ejercicios. Una simulación de mesa permite practicar decisiones y coordinación; una prueba técnica verifica restauración de sistemas; un simulacro integrado combina personas, comunicaciones y servicios. Cada ejercicio necesita criterios de éxito, supuestos y un registro de deficiencias. «Se ha realizado una prueba» dice poco si no se conoce qué se probó y cuál fue el resultado. Los hallazgos requieren responsables, plazos y repetición de pruebas cuando proceda. La resiliencia se demuestra en comportamientos observables, no en la existencia de un documento firmado.

Conceptos de este apartado

  • Tabletop
  • Pruebas técnicas de recuperación
  • Simulacros integrados
  • Criterios de éxito
  • Registro de deficiencias
  • Plan de remediación y re-prueba

Un caso para comprenderlo

Un hospital conserva copias de seguridad, pero tarda días en recuperar sistemas porque no se han probado los procedimientos y depende de una cuenta administrativa inaccesible. El análisis BIA permite priorizar servicios, definir objetivos de recuperación y diseñar ejercicios. La resiliencia solo es real si los procesos de restauración funcionan bajo condiciones difíciles.

Cómo aplicar estos conceptos

El punto de partida es describir el sistema o situación con precisión, distinguir hechos de suposiciones y seleccionar qué información permitiría comprobar una conclusión. A partir de ahí se identifican riesgos, controles, responsabilidades y evidencias posibles. La utilidad de estos conocimientos aumenta cuando se relacionan con otras áreas de la ciberseguridad y del Derecho informático.

Fuentes y lecturas de referencia

Lecturas relacionadas