Los desafÃos de seguridad del Big Data
El Big Data es un conjunto emergente de tecnologÃas que permite a las organizaciones obtener información más detallada sobre sus enormes volúmenes de datos para tomar mejores decisiones de negocio y lograr una mayor satisfacción del cliente. La agregación de datos en los sistemas de Big Data también los convierte en un objetivo atractivo para los hackers. Las organizaciones deben ser capaces de gestionar estos datos de forma eficiente y proteger la información confidencial de los clientes para cumplir con las leyes de privacidad y los requisitos normativos. La seguridad del Big Data es compleja por diversos motivos.
Algunos de ellos se mencionan a continuación:
- Existen múltiples fuentes de datos en tiempo real provenientes de distintas fuentes con distintas necesidades de protección.
- Se combinan múltiples tipos de datos.
- Muchos usuarios diferentes acceden a los datos con distintos requisitos analÃticos.
- Herramientas en rápida evolución financiadas por la comunidad de código abierto.
- Replicación automática de datos en múltiples nodos.
Formas de proteger datos en el entorno Hadoop
Hay varias formas de proteger datos en un entorno Hadoop:
- Cifrado a nivel del sistema de archivos: Este cifrado Se utiliza comúnmente para proteger información confidencial en archivos y carpetas. Este tipo de cifrado también se conoce como cifrado de datos en reposo. Los datos se cifran a nivel de archivo y se protegen mientras están almacenados en los servidores de datos. Sin embargo, este método no protege los datos cuando se ejecutan dentro del sistema. Los datos se descifran automáticamente cuando el sistema operativo los lee, y quedan totalmente expuestos a cualquier usuario o proceso, autorizado o no, que acceda al sistema.
- Cifrado de la base de datos: El cifrado a nivel de sistema de archivos también se puede usar para proteger los datos almacenados en una base de datos. Existen diversas técnicas para el cifrado de bases de datos, como el cifrado transparente de datos (TDE) y el cifrado a nivel de columna. El TDE se utiliza para cifrar una base de datos completa. El cifrado a nivel de columna permite cifrar columnas individuales de una base de datos.
- Cifrado a nivel de transporte: Este cifrado se utiliza para proteger los datos en movimiento mediante SSL / TLS Protocolos.
- Cifrado a nivel de aplicación: Este cifrado utiliza API para proteger los datos a nivel de aplicación.
- Cifrado que preserva el formato: FPE Encripta los datos sin modificar su formato original. Esto permite que las aplicaciones y bases de datos los utilicen. La protección de datos se aplica a nivel de campo, lo que permite proteger las partes sensibles y dejar las no sensibles para las aplicaciones. Dado que un gran volumen de datos de múltiples fuentes, como sensores de máquinas, registros de servidores y flujos de aplicaciones, se ingiere en el Data Lake de Hadoop, este actúa como un repositorio central para un conjunto de datos amplio y diverso. El Data Lake requiere una seguridad integral, ya que almacena datos empresariales vitales y, a menudo, altamente confidenciales. Los datos se pueden proteger en varias etapas de Hadoop (antes, durante o después de ingresar al Data Lake).
- Protección de datos en la aplicación de origen: En este escenario, los datos se cifran antes de importarlos a Hadoop. Este es el escenario ideal. Esto garantiza la protección de los datos durante todo su ciclo de vida y que Hadoop no esté sujeto a las normativas de cumplimiento. Esta opción requiere una interfaz con las aplicaciones de origen para el cifrado y tokenizaciónLuego, los datos protegidos se importan a Hadoop.
- Protección de datos durante la importación a Hadoop: Esta opción no requiere acceso a las aplicaciones de origen. En este caso, los datos se protegen en la zona de aterrizaje al entrar en Hadoop.
- Protección de datos en Hadoop: Esta opción protege los campos de datos una vez identificados en Hadoop. Utiliza interfaces que se ejecutan dentro de los trabajos de Hadoop. Se integrará con diferentes módulos de Hadoop, como Hive, Impala, Sqoop, Spark, Storm, Kafka, NiFi, etc.
- Cifrado a nivel de almacenamiento dentro de Hadoop: El nivel de almacenamiento cifrado Protege los datos tras el robo fÃsico o la pérdida accidental de un volumen de disco. Esta opción utiliza TDE dentro del Sistema de Archivos Distribuido de Hadoop (HDFS) para crear una zona de aterrizaje segura. Esta opción ralentiza el sistema. Para mayor seguridad, las claves deben gestionarse en [ubicación no especificada]. Módulos de seguridad de hardware al utilizar TDE.

