Cabecera personalizada

El blog de Mikel Niño
Industria 4.0, Big Data Analytics, emprendimiento digital y nuevos modelos de negocio
Mostrando entradas con la etiqueta apache-spark. Mostrar todas las entradas
Mostrando entradas con la etiqueta apache-spark. Mostrar todas las entradas

Notas del meetup “Big Data, Frankfurt v 2.0”

La semana pasada acudí al meetup Big Data, Frankfurt v2.0, celebrado en la sede en Frankfurt de Codecentric, una empresa de desarrollo de software con múltiples sedes en Alemania. El evento estaba también impulsado por Dataconomy, un portal web radicado en Berlín especializado en la difusión de noticias y organización de eventos en torno a los avances tecnológicos para el tratamiento y análisis de datos. El evento también contó con representantes de Cloudera, una de las empresas más relevantes a nivel internacional en cuanto al desarrollo y distribución de tecnologías Big Data, y de la startup local Clark, especializada en un servicio de explotación de datos para la recomendación inteligente a usuarios sobre alternativas de seguros.

My paper "Understanding Big Data: antecedents, origin and later development"

[Open access link to the paper at the end]

After the lecture I gave last June to open the conference held in San Sebastián on Big Data applications for businesses, the editors of the journal "DYNA New Technologies" contacted me to ask for a collaboration paper, where I could gather the key ideas presented during my lecture. After organizing my notes using a temporal guiding thread, and after the usual reviewing milestones, my paper "Understanding Big Data: antecedents, origin and later development" was published.

Análisis del panorama actual del Big Data elaborado por Matt Turck

A principios del pasado mes de febrero Matt Turck publicó en su blog su cuarta revisión (aquí los enlaces a la primera, segunda y tercera versión) del panorama en torno al Big Data, recogido en su Big Data Landscape 2016” a modo de gran mosaico de tecnologías, aplicaciones y empresas. Más allá del valor en sí de la infografía (sin duda con un enorme trabajo de recopilación y elaboración detrás), el contenido de la entrada de blog donde se publica recoge varias reflexiones importantes sobre el recorrido del Big Data desde sus orígenes y las tendencias que se apuntan en los últimos años, y que merece la pena revisar con algo más de detalle.

Claves principales de los "Resilient Distributed Datasets" (RDD) de Apache Spark

Cuando presentamos el origen y fundamentos de Apache Spark ya hablábamos de cómo su motivación se basaba en resolver mejor ciertos casos de uso donde MapReduce (en su versión original) no era eficiente por el alto coste en tiempo de las sucesivas lecturas/escrituras en memoria secundaria (disco). También comentábamos que, para cumplir su objetivo de aprovechar más el almacenamiento en memoria principal, Matei Zaharia concibió una abstracción de datos llamada Resilient Distributed Datasets -RDD- (concepto que sustenta los fundamentos de Apache Spark), que pueden residir tanto en disco como en memoria principal. Vamos a entrar más en detalle en este concepto para conocer las claves principales de los RDD.

Mi artículo “Entendiendo el Big Data: antecedentes, origen y desarrollo posterior”

[El enlace para acceder al artículo se encuentra al final de esta entrada]

Tras la ponencia que impartí el pasado mes de junio en la jornada organizada en San Sebastián sobre Big Data para los negocios, los responsables de la revista técnico-científica “DYNA New Technologies” se pusieron en contacto conmigo para solicitarme una colaboración en forma de artículo, donde recogiese las ideas principales de lo expuesto en dicha ponencia. De la organización de mis notas y su desarrollo en un hilo conductor histórico, y tras pasar los convenientes ciclos de revisión durante los últimos meses, nace el artículo “Entendiendo el Big Data: antecedentes, origen y desarrollo posterior” cuya reciente publicación anuncio y comparto en esta entrada de blog.

[Visita guiada] Big Data: origen y tecnologías principales

En esta visita guiada por el blog agrupo las entradas que repasan el origen del Big Data y varias de las principales tecnologías desarrolladas desde entonces:
  1. Para comenzar, ten a mano el siguiente cronograma de antecedentes, origen y desarrollo del Big Data [ver entrada], que te será de utilidad a modo de mapa de la visita guiada
  2. Revisa la definición de los principales términos clave en torno al análisis de datos [ver entrada], conceptos que iremos desarrollando a lo largo de la visita guiada. Repasa también la evolución histórica de la relevancia que han tenido dichos términos [ver entrada]

YARN: la evolución interna de Apache Hadoop

Al revisar el origen y motivación en el desarrollo de Apache Spark, ya veíamos que su objetivo era proporcionar una mejor alternativa para determinados casos de uso de procesamiento de datos en los que el modelo MapReduce no era del todo eficiente, tal y como estaba concebido de inicio e implementado por ejemplo en Apache Hadoop. El propio Hadoop ha ido haciendo frente a alguna de estas limitaciones, dentro de su evolución en sus sucesivas versiones. El hito más significativo lo marca la revisión que a finales de 2011 sufre en una parte importante de su implementación del modelo MapReduce, con la mejora aportada por YARN (Yet Another Resource Negotiatior), su nuevo gestor interno de tareas y recursos.

Apache Spark: origen, motivación y fundamentos principales

Tras el hito marcado por la aparición de Apache Hadoop implementando el modelo MapReduce, y dentro del constante desarrollo de nuevas herramientas y plataformas orientadas al procesamiento de Big Data durante estos años, posiblemente la aparición más relevante (por su potencial como “heredero” o sucesor más importante de Hadoop, aunque pueden utilizarse juntos) sea la de Apache Spark, la pieza nuclear de lo que se conoce como la Berkeley Data Analytics Stack (BDAS). Vamos a revisar cuál es la motivación que origina la creación de esta herramienta y los fundamentos en que se basa.