Cabecera personalizada

El blog de Mikel Niño
Industria 4.0, Big Data Analytics, emprendimiento digital y nuevos modelos de negocio
Mostrando entradas con la etiqueta machine-learning. Mostrar todas las entradas
Mostrando entradas con la etiqueta machine-learning. Mostrar todas las entradas

Entrevistas a "leading data scientists" a nivel internacional en el blog ODBMS.org de Roberto V. Zicari

Roberto V. Zicari (con quien he tenido el placer de colaborar en el Frankfurt Big Data Lab y preparar artículos conjuntamente) ha iniciado recientemente en su blog una serie de cuestionarios (“Q&A with data scientists”) a científicos de datos, todos ellos profesionales de dilatada carrera desempeñando puestos de responsabilidad en universidades de todo el mundo y en organizaciones como Google, Apple, IBM, GE, Thomson Reuters, SAS, PwC, etc. Semejante plantel de interlocutores hace de esta serie de entrevistas toda una mina de conocimiento de la que extraer muy valiosas aportaciones sobre la práctica de data science desde diversas perspectivas.

Mi seminario sobre Big Data enfocado a perfiles directivos

El pasado mes de febrero impartí un seminario de media jornada dentro del programa de formación para directivos de la Cámara de Comercio de Gipuzkoa (a quienes aprovecho para agradecer su propuesta de colaboración). Aparte de quedarme con muy buenas sensaciones por la acogida del seminario y el feedback recibido de asistentes y organización, la experiencia me resultó de lo más interesante y enriquecedora. Además de una numerosa asistencia, me encontré con unos asistentes muy motivados por comprender las claves del Big Data en particular y la analítica de datos en general desde el punto de vista directivo y ejecutivo. Fue sumamente enriquecedor recoger los comentarios de gerentes y directivos de organizaciones de muy diferentes sectores: banca, transporte, manufactura, seguros, turismo, educación, e-commerce, centros tecnológicos, consultoría TIC...

¿Qué puede hacer (y qué no) la analítica predictiva?

Como hemos comentado anteriormente en el blog, gran parte del interés actual por la aplicación de las tecnologías Big Data y la analítica de datos en los negocios viene por el mayor valor y retorno potenciales a obtener de la aplicación de la analítica predictiva. Esto a su vez implica una mayor complejidad en estos proyectos que muchas veces se pasa por alto o no se termina de comprender totalmente al plantearse iniciar un proyecto en este campo. En otras ocasiones se tiene una cierta “percepción distorsionada” de lo que este tipo de técnicas pueden lograr realmente, otorgándoles capacidades que están bastante lejos de lo que en realidad se puede esperar de ellas hoy en día. En esta línea, Andrew Ng (uno de los mayores expertos en el área del aprendizaje automático, y parte implicada en los proyectos más importantes en este campo a nivel global) publicó hace escasos días un interesante artículo bajo el título “What Artificial Intelligence can and can’t do right now”, cuyas claves principales quiero repasar en esta entrada.

Repaso de diferentes perspectivas para entender la “ciencia de datos” (data science)

En anteriores entradas del blog hemos revisado el desarrollo del concepto de “ciencia de datos” (data science) y cómo su origen se remonta a principios de milenio con la propuesta de William S. Cleveland de revisión de las áreas técnicas en torno a la Estadística para adecuarse mejor a las nuevas prácticas de análisis de datos y al desarrollo del data mining. Sin embargo, no es hasta bastantes años después, y en paralelo a la eclosión del Big Data, cuando el concepto de ciencia de datos adquiere mayor relevancia. El Data Science Venn Diagram” elaborado en 2010 por Drew Conway y publicado en su blog en 2013 supone un hito a reseñar de cara a dar a conocer dicho concepto y las áreas que integra.

Conceptos básicos de “Machine Learning” (Aprendizaje Automático): algoritmos vs modelos

Hace ya bastantes meses de la entrada en la que presentaba unos conceptos básicos sobre Machine Learning, uno de los pilares tecnológicos en los que se apoya la analítica predictiva y gran parte de la popularidad que ha ido ganando con los años el Big Data. Partiendo de esas primeras nociones básicas, en esta entrada quiero detallar la diferencia entre dos conceptos clave que he visto que generalmente provocan confusión entre quienes se acercan por vez primera a estas herramientas. Me refiero a diferenciar entre lo que son los algoritmos que generan modelos predictivos y lo que son los propios modelos en sí.

La relación entre valor y complejidad en los proyectos de análisis de datos

En diversas charlas y presentaciones sobre Big Data y análisis de datos durante los últimos años se viene empleando un diagrama (el que aparece a la izquierda de este párrafo) que, bajo el título “The next step in Business Intelligence”, sitúa la analítica predictiva dentro del contexto de diferentes enfoques en el análisis de datos y de los diferentes tipos de cuestiones que buscan responder, y con diferencias también en cuanto al marco temporal en el que se encuadra el análisis que se desarrolla dentro de cada enfoque.

Mi participación en la 3ª edición de “DataBeers Euskadi”

Esta tarde tendré el placer de hacer la apertura del programa de mini-charlas de la tercera edición de “DataBeers Euskadi” que se celebra en San Sebastián. Este evento, inspirado en los DataBeers” inicialmente organizados en Madrid, giran en torno a un programa de breves charlas sobre la analítica de datos en un ambiente distendido, con tiempo para el networking y la conversación informal cerveza en mano.

[Visita guiada] Desmontando mitos del Big Data

En esta breve visita guiada por las entradas del blog propongo un recorrido centrado en desmontar algunos de los mitos principales que rodean la vorágine que se ha creado en los últimos años en torno al Big Data:
  1. Para comenzar, revisa las diferencias entre los diferentes enfoques para la analítica de datos [ver entrada], junto con la definición de los términos clave en torno al análisis de datos [ver entrada] y la evolución histórica de su relevancia [ver entrada]
  2. Sitúa el Big Data dentro del campo de la Ciencia de Datos y la analítica para extraer conocimiento de los datos [ver entrada 1] [ver entrada 2], para así encuadrarlo en el contexto anterior

El carácter exploratorio y de "descubrimiento" de los proyectos de análisis predictivo de datos

Al hablar de los diferentes enfoques en los que podemos clasificar la analítica de datos (descriptiva, predictiva o prescriptiva), hemos destacado el principal interés que despiertan los proyectos de analítica predictiva debido al valor adicional que ofrece la detección temprana de las situaciones de negocio que se precisen controlar. Sin embargo, en muchos (demasiados) discursos de “venta del Big Data” se presta exclusiva atención a este valor adicional, sin hacer hincapié en su carácter de potencial y simplificando en exceso la complejidad inherente a estos proyectos.

Mi participación en la jornada “Big Data para Pymes locales” organizada por Fomento de San Sebastián

El pasado día 20 de abril tuve el placer de abrir la jornada divulgativa organizada por Fomento de San Sebastián (a quienes quiero agradecer su propuesta de participar en el evento) para acercar el Big Data a las pymes (podéis acceder a las diapositivas de mi presentación en este enlace). Cuando me proponen impartir la ponencia de apertura en este tipo de eventos, siempre suelo procurar que el enfoque de la charla (al menos la primera parte) sea el de poner en común con la audiencia unas mínimas bases (sin entrar en temas muy técnicos ni profundizar en herramientas o tecnologías concretas) para comprender realmente qué es y (cada vez más importante) qué no es esto del Big Data, en qué consiste realmente y cuáles son los aspectos fundamentales que entiendo que deben analizar y evaluar quienes estén pensando en alguna idea de proyecto en este campo.

Chronology of antecedents, origin and development of Big Data

[Accede aquí a la versión en español]

One of the contents that I use in my lectures on Big Data (and that I have often seen included and referenced in other works and speeches) is a set of chronological charts with different milestones related to the antecedents of Big Data (the first applications of data analysis in business contexts), its origin and later development. As I had this temporal thread fragmented in different slides, I thought of publishing one chronological chart grouping the main milestones I use to present.

Historical evolution of key terms related to data analysis

[Accede aquí a la versión en español]

From the definition of key terms around data analysis that are related today to the concept of Big Data, how could we have a clearer idea of their origin, when the relevance of each concept dates back to and how that relevance has evolved along the years? Modern web search tools allow us to visualize historical information that has been extracted automatically from different sources and present it in this interesting example of analysis on those terms related to data analysis itself and Big Data.

Evolución histórica de la relevancia de los diferentes términos que rodean al Big Data

[Click here for the English version]

Partiendo de la definición de los términos clave en torno al análisis de datos que se relacionan hoy en día con el concepto de Big Data, ¿cómo podríamos tener un reflejo más claro de su origen, desde cuándo data la relevancia de cada concepto y cómo ha sido la evolución histórica de dicha relevancia? Las herramientas web de las que disponemos hoy en día nos permiten visualizar información histórica recopilada automáticamente de diferentes fuentes y presentarla en este curioso ejemplo de análisis sobre los propios términos en torno al análisis de datos y el Big Data.

Análisis del panorama actual del Big Data elaborado por Matt Turck

A principios del pasado mes de febrero Matt Turck publicó en su blog su cuarta revisión (aquí los enlaces a la primera, segunda y tercera versión) del panorama en torno al Big Data, recogido en su Big Data Landscape 2016” a modo de gran mosaico de tecnologías, aplicaciones y empresas. Más allá del valor en sí de la infografía (sin duda con un enorme trabajo de recopilación y elaboración detrás), el contenido de la entrada de blog donde se publica recoge varias reflexiones importantes sobre el recorrido del Big Data desde sus orígenes y las tendencias que se apuntan en los últimos años, y que merece la pena revisar con algo más de detalle.

El valor adicional de la analítica predictiva frente a la descriptiva

En una entrada anterior del blog repasábamos las diferencias entre los enfoques en los que habitualmente se clasifica la analítica de datos: descriptiva, predictiva o prescriptiva. Si revisamos la correspondencia de estos tipos de analítica de datos con la aplicación de tecnologías Big Data, a juzgar por el tipo de proyectos que se difunden en contextos académicos, profesionales o incluso en medios generalistas, vemos que la mayor parte de los casos están ligados a la analítica predictiva y, según las posibilidades que propicie el escenario de uso concreto, también prescriptiva. Tanto es así que en muchos (demasiados) foros se mezclan y confunden los conceptos de analítica predictiva y las propias tecnologías Big Data, asimilando erróneamente esto último como cualquier aplicación de minería de datos. ¿Por qué la analítica predictiva/prescriptiva acapara tanto interés en los proyectos de analítica de datos en contextos de negocio? La clave está en el valor adicional que ofrece la detección temprana de aquellas situaciones que un negocio precise controlar.

Notas-resumen de la segunda edición de la “International Winter School on Big Data” (BigDat 2016)

El mes pasado tuve la ocasión de acudir a la segunda edición de la International Winter School on Big Data, en la que durante cinco días (con un horario muy intensivo) y a lo largo de varios cursos en paralelo se repasan las principales tendencias de investigación académica en torno a las tecnologías Big Data de la mano de expertos de diferentes universidades y centros de investigación de todo el mundo. La primera edición fue lanzada el año pasado por la Universitat Rovira i Virgili de Tarragona, donde también estuve presente. En esta segunda edición han formado tándem con la Universidad de Deusto para su organización, con lo que en esta ocasión la sede escogida fue el campus bilbaíno de esta última universidad.

Entendiendo la diferencia entre analítica de datos descriptiva, predictiva y prescriptiva

Cuando recopilamos datos de un proceso de negocio, sea del sector que sea, y queremos extraer valor de los mismos a través de su análisis, podemos afrontar la tarea con diferentes objetivos para dicha analítica. Es habitual hablar de tres diferentes niveles o perspectivas en la analítica de datos (analítica descriptiva, predictiva o prescriptiva), donde las técnicas y herramientas que deberemos emplear dependerán de si nos enfocamos a una u otra. En esta entrada revisaremos las principales diferencias entre estos tres enfoques para la analítica de datos y la manera en que cada uno de ellos facilita los procesos de toma de decisión dentro de un negocio.

Cronología de antecedentes, origen y desarrollo del Big Data

[Click here for the English version]

Uno de los contenidos que utilizo en mis charlas divulgativas sobre Big Data que posteriormente he visto más utilizado y referenciado en otros trabajos y exposiciones son los cuadros cronológicos con los diferentes hitos referidos a los antecedentes del Big Data (los primeros contextos de aplicación del análisis de datos de negocio), su origen y posterior desarrollo. Como hasta ahora tenía este hilo temporal segmentado en diferentes diapositivas, he pensado en publicar un único cuadro cronológico que agrupe los principales hitos a los que suelo hacer referencia.

Enfoques alternativos a MapReduce para el procesamiento de Big Data

La estrategia en la que se basa el modelo MapReduce para procesar cantidades masivas de datos podría resumirse en la conocida idea de “la unión hace la fuerza”: aprovechar las capacidades hasta cierto punto “modestas” de un gran número de máquinas que, junto a una eficiente gestión de su trabajo en paralelo gracias al framework que proporcionan las implementaciones de MapReduce sobre un sistema de ficheros distribuidos, presentan una combinación potente y al mismo tiempo flexible para poder escalar en su capacidad de procesamiento de datos. Sin embargo no todo es MapReduce en el mundo de los datos masivos, y existen otras estrategias diferentes para este mismo fin.