Ponte en Contacto

Temario del curso

Introducción

Comprensión de Big Data

Visión general de Spark

Visión general de Python

Visión general de PySpark

  • Distribución de datos utilizando el framework Resilient Distributed Datasets
  • Distribución de computación utilizando los operadores de la API de Spark

Configuración de Python con Spark

Configuración de PySpark

Uso de instancias EC2 de Amazon Web Services (AWS) para Spark

Configuración de Databricks

Configuración del clúster AWS EMR

Aprendizaje de los fundamentos de la programación en Python

  • Introducción a Python
  • Uso de Jupyter Notebook
  • Uso de variables y tipos de datos simples
  • Trabajo con listas
  • Uso de sentencias if
  • Uso de entradas de usuario
  • Trabajo con bucles while
  • Implementación de funciones
  • Trabajo con clases
  • Trabajo con archivos y excepciones
  • Trabajo con proyectos, datos y APIs

Aprendizaje de los fundamentos de Spark DataFrame

  • Introducción a Spark DataFrames
  • Implementación de operaciones básicas con Spark
  • Uso de operaciones Groupby y de agregación
  • Trabajo con marcas de tiempo y fechas

Trabajo en un ejercicio de proyecto de Spark DataFrame

Comprensión del Machine Learning con MLlib

Trabajo con MLlib, Spark y Python para Machine Learning

Comprensión de las regresiones

  • Estudio de la teoría de la regresión lineal
  • Implementación de un código de evaluación de regresión
  • Trabajo en un ejercicio de muestra de regresión lineal
  • Estudio de la teoría de la regresión logística
  • Implementación de un código de regresión logística
  • Trabajo en un ejercicio de muestra de regresión logística

Comprensión de Random Forests y árboles de decisión

  • Estudio de la teoría de los métodos de árboles
  • Implementación de códigos para árboles de decisión y Random Forests
  • Trabajo en un ejercicio de muestra de clasificación con Random Forests

Trabajo con clustering K-means

  • Comprensión de la teoría del clustering K-means
  • Implementación de un código de clustering K-means
  • Trabajo en un ejercicio de muestra de clustering

Trabajo con sistemas de recomendación

Implementación de procesamiento de lenguaje natural

  • Comprensión del procesamiento de lenguaje natural (NLP)
  • Visión general de herramientas de NLP
  • Trabajo en un ejercicio de muestra de NLP

Streaming con Spark en Python

  • Visión general del Streaming con Spark
  • Ejercicio de muestra de Spark Streaming

Requerimientos

  • Conocimientos generales de programación

Audiencia

  • Desarrolladores
  • Profesionales de TI
  • Científicos de datos
 21 Horas

Número de participantes


Precio por participante

Reseñas (6)

Próximos cursos

Categorías Relacionadas