Spark SQL es un módulo de Spark para el procesamiento de datos estructurados. A diferencia de la API básica Spark RDD, las interfaces propo...
Spark SQL es un módulo de Spark para el procesamiento de datos estructurados. A diferencia de la API básica Spark RDD, las interfaces propo...
El rendimiento de los sistemas de Big Data está directamente relacionado con la distribución uniforme de los datos de procesamiento entre t...
En el siguiente documento tienes una guía completa de como puedes empezar a escribir una Aplicación Kafka Streams en Scala desde 0.
El aprendizaje de Kafka es complicado. Aunque el núcleo de Kafka se mantenga bastante estable con el tiempo, los frameworks que envuelven a...
Cloudera ha lanzado recientemente Cloudera Data Platform (CDP), su nueva plataforma de datos insignia que permite a los clientes gestionar ...
En el examen, se le puede pedir que cree un directorio de inicio para un usuario local existente en HDFS. Es posible que se le solicite que...
Comparto en este post el excelente libro de Andrew G. Psaltis enfocado para desarrolladores y arquitectos que quieran comprender un sistema...
Vivimos en la era de la revolución del conocimiento, cuando el poder de una nación no está determinado por el número de soldados de su ejér...
Para el 2020, la Inteligencia Artificial (IA) y las tecnologías asociadas estarán presentes en muchas industrias, dentro de un número consi...
Voy a realizar un análisis estadístico básico de la cuenta de tweeter @realDonaldTrump de cara a un posterior análisis de sentimientos (int...
En este artículo voy a extraer datos de Twitter usando tweepy y a mostrar cómo gestionarlos usando pandas. Explicaré la publicación completa...
Un componente de arquitectura importante de cualquier plataforma de datos son aquellas piezas que gestionan la ingestión de datos. En muchos...
En una publicación anterior aborde el tema de la ingestión de datos masivos usando la herramienta Flume (consúltala aquí ). Siguiendo con e...
Esta publicación introductoria está destinada a ayudarte a dar el primer paso en el procesamiento de Big Data con Apache Spark utilizando l...
Flume está diseñado para la ingestión de grandes volúmenes de datos basados en eventos en Hadoop. El ejemplo clásico es usar Flume para rec...
La película de 2011 Moneyball representa la verdadera historia del manager de béisbol Billy Beane (interpretado por Brad Pitt) que desafía ...
El fraude y los delitos financieros ya no pueden ser un coste aceptable al hacer negocios. Los esquemas de fraude son cada vez más sofistic...
La IA puede mejorar la personalización de los clientes, identificar patrones y conexiones que los humanos no pueden, y responder a pregunta...
En este artículo voy a hablar de varias herramientas diferentes que se utilizan en la parte superior del framework Hadoop. Con la evolución...
Ya va a hacer un año de lo que muchos bautizaron como uno de los principales hitos de la historia de la Inteligencia Artificial. Un algorit...
La idea de que las tecnologías SQL y NoSQL están en oposición directa y compitiendo entre sí es absolutamente errónea, lo que se evidencia ...
Utilizar un servidor independiente, un servidor mongod único, es una manera fácil de empezar, pero una forma peligrosa de funcion...
Entre las implicaciones del movimiento <<Big Data>> se encuentra la creciente demanda de sistemas de gestión de bases de datos ...
Se puede decir sin lugar a dudas que Internet y la web nos ha cambiado la vida. De hecho, la web es la mayor fuente de información que exis...
Ya he mencionado que un modelo de datos se caracteriza por la estructura de datos que admite, las operaciones sobre esa estructura y la for...
El tercer componente de un modelo de datos son las restricciones. Una restricción de datos es una expresión lógica, lo que significa que se...
El segundo componente de un modelo de datos es el conjunto de operaciones que se pueden realizar sobre los datos. En este módulo voy a anal...
En el mundo de Big Data escuchamos frecuentemente el término "datos estructurados", es decir, datos que tienen una estructura que...
En este modulo voy a hablar de los modelos de datos. Si has seguido el curso de introducción en mi blog, puede que recuerdes el artículo so...
Vamos a pensar en una aplicación real que demuestre la utilidad y los retos de Big Data. Muchas industrias gestionan por naturaleza grandes...