Aprende a aplicar tecnologías Big Data en el ámbito de la ingeniería para procesar, analizar y gestionar grandes volúmenes de datos. Conocerás herramientas y metodologías que permiten optimizar procesos, mejorar la toma de decisiones y desarrollar soluciones basadas en datos en entornos industriales, científicos y tecnológicos.
Emagister S.L. (responsable) tratará tus datos personales con la finalidad de gestionar el envío de solicitudes de información y comunicaciones promocionales de formación con tu consentimiento. Ejerce tus derechos de acceso, supresión, rectificación, limitación, portabilidad y otros, según se indica en nuestra política de privacidad.
Objetivos
Adquirir competencias en Big Data aplicadas a ingenierías, abarcando la gestión, procesamiento y análisis de grandes volúmenes de datos mediante Hadoop, Spark y herramientas de consulta como Hive e Impala, además de aprender técnicas de machine learning y procesamiento en tiempo real.
A quién va dirigido
Personas trabajadoras y desempleadas cotizantes en España.
Requisitos
Cumplir como mínimo alguno de los siguientes requisitos: -Título de Bachiller o equivalente. -Título de Técnico Superior (FP Grado superior) o equivalente. -Haber superado la prueba de acceso a Ciclos Formativos de Grado Superior-Certificado de profesionalidad de nivel 3.
Temario completo de este curso
MÓDULO DE FORMACIÓN 1: Fundamentos de Big Data y Procesamiento de datos. Conocimientos / Capacidades cognitivas y prácticas
• Conocimiento de los fundamentos de Big Data
- Definición y conceptos básicos de Big Data.
• Características de Big Data (las 8 Vs).
• Principales paradigmas de procesamiento en Big Data.
- Introducción a los sistemas de almacenamiento distribuido.
• Procesamiento de Datos
- Introducción a Hadoop y el sistema de archivos HDFS.
- Funcionamiento de MapReduce en Hadoop.
- Gestión de recursos con YARN.
- Ingestión de datos con Apache Flume y Sqoop.
- Configuración de seguridad en Hadoop con Kerberos.
• Conocimiento de procesos y herramientas que favorecen la eficiencia
energética en el trabajo con grandes volúmenes de datos.
Habilidades de gestión, personales y sociales
• Preocupación por el seguimiento y cumplimiento de políticas de protección de datos.
• Preocupación por el seguimiento y cumplimiento de políticas y regulaciones de seguridad.
• Cumplimiento de normas éticas y legales.
• Trabajo buscando la eficiencia energética (reducción del uso de memoria
volátil y persistente, uso de entornos de desarrollo con impacto reducido en el consumo de recursos, etc.).
MÓDULO DE FORMACIÓN 2: Procesamiento Avanzado, Ciencia de Datos y Aprendizaje Automático. Conocimientos / Capacidades cognitivas y prácticas
• Procesamiento Avanzado con Spark - Conceptos básicos y ventajas de Spark.
- Uso de DataFrames y Spark SQL para análisis de datos.
- Operaciones con DataFrames y optimización de consultas.
- Operaciones con Resilient Distributed Datasets (RDDs).
- Ejecución de aplicaciones en Spark y manejo de clusters.
• Uso de la ciencia de Datos y Machine Learning
- Introducción a Spark MLlib y algoritmos básicos de machine learning. - Modelado, evaluación y validación de modelos de datos.
- Librerías y funciones de MLlib para procesamiento de datos. - Implementación de pipelines de machine learning.
- Habilidades de gestión, personales y sociales
• Enfoque analítico y habilidades para tomar decisiones basadas en datos.
• Automatización de tareas e incremento de la eficiencia.
• Trabajo buscando la eficiencia energética (reducción del uso de memoria
volátil y persistente, uso de entornos de desarrollo con impacto reducido en el consumo de recursos, etc.).
MÓDULO DE FORMACIÓN 3: Conocimientos / Capacidades cognitivas y prácticas
• Análisis y Almacenamiento de Datos
- Introducción a Hive e Impala para consultas SQL en Hadoop.
- Creación y gestión de tablas y bases de datos.
- Consultas avanzadas con HiveQL y optimización de Impala.
- Análisis de datoscomplejos con Hive y consultas de Impala.
• Procesamiento en Tiempo Real
- Fundamentos de Spark Streaming y fuentes de datos en tiempo real.
- Configuración y ejecución de flujos de datos en Spark.
- Integración con Apache Kafka para ingestión de datos en tiempo real.
- Análisis en streaming y actualización en tiempo real.
- Habilidades de gestión, personales y sociales.
• Enfoque analítico y habilidades para tomar decisiones basadas en datos.
• Automatización de tareas e incremento de la eficiencia.
• Trabajo buscando la eficiencia energética (reducción del uso de memoria
volátil y persistente, uso de entornos de desarrollo con impacto reducido en el consumo de recursos, etc.).
Análisis y Procesamiento en tiempo reaL