Cabecera personalizada

El blog de Mikel Niño
Industria 4.0, Big Data Analytics, emprendimiento digital y nuevos modelos de negocio
Mostrando entradas con la etiqueta uc-berkeley. Mostrar todas las entradas
Mostrando entradas con la etiqueta uc-berkeley. Mostrar todas las entradas

Claves principales de los "Resilient Distributed Datasets" (RDD) de Apache Spark

Cuando presentamos el origen y fundamentos de Apache Spark ya hablábamos de cómo su motivación se basaba en resolver mejor ciertos casos de uso donde MapReduce (en su versión original) no era eficiente por el alto coste en tiempo de las sucesivas lecturas/escrituras en memoria secundaria (disco). También comentábamos que, para cumplir su objetivo de aprovechar más el almacenamiento en memoria principal, Matei Zaharia concibió una abstracción de datos llamada Resilient Distributed Datasets -RDD- (concepto que sustenta los fundamentos de Apache Spark), que pueden residir tanto en disco como en memoria principal. Vamos a entrar más en detalle en este concepto para conocer las claves principales de los RDD.

Apache Spark: origen, motivación y fundamentos principales

Tras el hito marcado por la aparición de Apache Hadoop implementando el modelo MapReduce, y dentro del constante desarrollo de nuevas herramientas y plataformas orientadas al procesamiento de Big Data durante estos años, posiblemente la aparición más relevante (por su potencial como “heredero” o sucesor más importante de Hadoop, aunque pueden utilizarse juntos) sea la de Apache Spark, la pieza nuclear de lo que se conoce como la Berkeley Data Analytics Stack (BDAS). Vamos a revisar cuál es la motivación que origina la creación de esta herramienta y los fundamentos en que se basa.