Qué pasó con DonWeb

Ya hablamos varias veces en el último tiempo de caídas masivas y esta vez le tocó a un proveedor argentino. Si no tuviste tu página, correo o sistema caídos los últimos cinco días, igual seguramente lo hayas visto en el diario (y hasta en Clarín): Cientos servidores alojados en DonWeb dejaron de funcionar y tomó varios días recuperarlos.

Medios y redes sociales hablan de un problema en el nodo Nova, como si Nova fuera un objeto y todos supieran qué es. Vamos a intentar echar algo de luz al asunto. Nova es solo un nombre, un nombre arbitrario que DonWeb le puso a una parte de su infraestructura. Esto es de hecho una práctica común, ya que es más fácil identificarlos, sobre todo durante el soporte técnico.

Un nodo es un conjunto de servidores físicos y de los sistemas de red, almacenamiento y administración que los unen y hacen funcionar. Sobre este hardware corrían muchos servidores, que son computadoras virtuales que se alquilan a los clientes. En otras palabras, al contratar uno de estos servidores no se contrata un equipo o computadora, sino solo una parte de ella, y como consumidores no tenemos noción de cuál es el hardware físico que finalmente la contiene, y eso, en pocas palabras, es lo que se llama la nube.

Es por esto que un problema en un nodo puede dejar fuera de servicio a muchas empresas a la vez, mientras que otros servicios pueden seguir operativos. Cayó todo lo que dependía del hardware en este área de la empresa.

La página de estado de DonWeb informó que el incidente comenzó el domingo 30 de agosto y alcanzaba al 100% del nodo. Lamentablemente, peor fue la falla en la comunicación, o la falta de ella. Primero informaron el reemplazo de un componente de conexión, una pieza de red que permite que los equipos se comuniquen. Después explicaron que la recuperación sería por etapas. Los backups estaban en infraestructura separada, pero era imposible acceder a ellos. Muchos usuarios dudaban de las copias de seguridad que DonWeb dice tener, pero la realidad es que una copia protege contra pérdidas de datos, no garantiza disponibilidad. Solo quedaba confiar.

Finalmente, el 3 de septiembre informaron que el nodo había vuelto a operar y que no se habían perdido datos. La cobertura de medios coo La Capital, Diario Río Uruguay y Revista Acción mostró el impacto: Para una pyme, significó no poder recibir consultas, vender ni facturar por días.

La explicación técnica publicada por DonWeb habla de una falla lógica: No se rompió necesariamente un disco o un servidor, sino el software que lo organiza y coordina dónde está la información de cada cliente.

Mi lectura es que el incidente afectó una capa compartida de almacenamiento distribuido, no una aplicación individual. El componente de conexión pudo ser un síntoma o haber expuesto una debilidad. También pudo haber sido producto de una tarea de mantenimiento mal ejecutada, o un error de software. La verdad es que no hay datos para afirmar cuál hipótesis es real, ni para hablar de hackeo, y solo nos queda ocuparnos de evitar que se repita.

La mitigación no consiste en buscar un proveedor que nunca falle, que no existe, sino en tomar medidas para evitar que una falla detenga todo. Conviene conservar copias independientes y verificadas, separar el dominio y el DNS y tener un servidor alternativo. También ayuda monitorear y definir tareas manuales de mantenimiento y contingencia. Un backup inutilizable durante la falla principal no es una recuperación completa. La caída terminó bien porque los datos fueron preservados. La pregunta es cuántas empresas podrían seguir funcionando hoy si el desenlace hubiera sido otro…

Quizás la parte más fea de este episodio fueron los usuarios de redes sociales culpando a los clientes por usar DonWeb. Realmente como profesionales debemos ser responsables pero también tolerantes y amables con quienes vienen detrás, quizás con menos experiencia para ver los riesgos, quizás simplemente confiando en el proveedor que eligieron.

Publicado el

en

¿Querés seguir la conversación?