Pandas Básico
🗺️ Mapa de la Lección
⏱ 2 horas🟡 Intermedio🎯 Qué aprenderás
- Crear y manipular DataFrames
- Leer y escribir archivos CSV, Excel
- Filtrar y seleccionar datos
- Agrupar y agregar datos
- Realizar operaciones básicas de análisis
🌍 Para qué te sirve
- Analizar ventas y métricas de negocio
- Procesar logs y datos de servidores
- Limpiar y transformar datos antes de análisis
- Generar reportes automáticos
- Preparar datos para machine learning
- Análisis exploratorio de datos (EDA)
🎯 ¿Por qué aprender Pandas?
Trabajas con datos en Excel o CSV. Necesitas filtrar, agrupar, calcular promedios, unir tablas. Podrías hacerlo manualmente, pero eso es lento y propenso a errores.
Pandas es esencial porque:
- Potente: maneja millones de filas fácilmente
- Flexible: filtra, agrupa, transforma datos con pocas líneas
- Integración: funciona con CSV, Excel, bases de datos, APIs
- Eficiente: optimizado para velocidad con datos grandes
- Estándar de la industria: usado en ciencia de datos, análisis, machine learning
Sin Pandas, analizar datos grandes sería muy lento y difícil.
🌍 Casos reales donde se usa
Pandas está en prácticamente todos los proyectos de análisis de datos:
- Analizar ventas: Métricas de negocio y reportes
- Procesar logs: Datos de servidores y aplicaciones
- Limpiar datos: Transformar datos antes de análisis
- Generar reportes: Automatizar reportes y visualizaciones
- Preparar datos: Para machine learning y análisis avanzado
- Análisis exploratorio: EDA (Exploratory Data Analysis)
Ejemplo real: Un analista de datos usa Pandas para procesar 100,000 registros de ventas, calcular promedios por región, identificar tendencias, y generar reportes automáticos en segundos.
💡 Concepto base
Pandas es como Excel pero programático. Puedes manipular, analizar y transformar datos tabulares con código Python.
Lo genial de Python: Pandas trabaja con DataFrames (tablas) y Series (columnas), haciendo que trabajar con datos sea muy intuitivo.
import pandas as pd
# Crear un DataFrame
datos = {
'producto': ['Chilaquiles', 'Tacos', 'Quesadillas'],
'precio': [85.50, 45.00, 60.00],
'ventas': [120, 200, 80]
}
df = pd.DataFrame(datos)
print(df)
print(f"\nPromedio de precios: ${df['precio'].mean():.2f}")
producto precio ventas
0 Chilaquiles 85.5 120
1 Tacos 45.0 200
2 Quesadillas 60.0 80
Promedio de precios: $63.50
Pandas es como tener un asistente de cocina súper organizado que puede manejar miles de recetas (filas de datos) a la vez. En lugar de revisar manualmente cada receta en tu libro de cocina para encontrar cuántas veces usaste chiles, Pandas puede buscar, filtrar, agrupar y analizar todas las recetas instantáneamente. Es como tener un sistema de inventario inteligente que puede decirte "cuántos platos usan queso", "cuál es el promedio de tiempo de preparación", o "qué ingredientes son más comunes", todo en segundos.
Antes de continuar: Asegúrate de entender Diccionarios y Sets, Funciones y Pathlib.
Concepto clave: Pandas trabaja con DataFrames (tablas) y Series (columnas). Es como trabajar con Excel pero con código. Si sabes usar Excel, Pandas será familiar.
Conceptos Básicos
DataFrame: La Estructura Principal
Un DataFrame es como una tabla de Excel: tiene filas (registros) y columnas (atributos). Es la estructura principal de Pandas.
import pandas as pd
# Crear un DataFrame desde un archivo CSV
df = pd.read_csv('datos.csv')
# df ahora contiene todos los datos del CSV como una tabla
# Ver las primeras 5 filas (útil para explorar datos)
print(df.head())
# Salida: Muestra las primeras 5 filas con todas las columnas
# Ver información del DataFrame (tipos, memoria, etc.)
print(df.info())
# Salida: Lista columnas, tipos de datos, valores no nulos, uso de memoria
¿Qué está pasando?
pd.read_csv()lee el archivo CSV y lo convierte en un DataFramedf.head()muestra una muestra de los datos (útil para verificar que se cargaron bien)df.info()te da un resumen técnico del DataFrame
Acceder a Columnas y Filas
Columnas (Series): Cada columna es una "Series" (lista con nombre)
# Acceder a una columna por nombre
columna = df['nombre_columna'] # Devuelve una Series
print(columna) # Muestra todos los valores de esa columna
# También puedes usar notación de punto (si el nombre no tiene espacios)
columna = df.nombre_columna # Equivalente a df['nombre_columna']
Filas: Puedes acceder a filas específicas
# Acceder a una fila por índice (posición)
fila = df.iloc[0] # Primera fila (índice 0)
print(fila) # Muestra todos los valores de esa fila como una Series
¿Cuándo usar cada uno?
- Columnas: Cuando quieres analizar un atributo específico (ej: todas las edades)
- Filas: Cuando quieres ver un registro completo (ej: todos los datos de una persona)
Operaciones Básicas de Exploración
Antes de analizar, explora tus datos:
# Ver dimensiones (cuántas filas y columnas)
print(df.shape) # (1000, 5) = 1000 filas, 5 columnas
# Ver nombres de todas las columnas
print(df.columns)
# Salida: Index(['nombre', 'edad', 'ciudad', 'salario', 'departamento'], dtype='object')
# Ver tipos de datos de cada columna
print(df.dtypes)
# Salida: nombre: object, edad: int64, ciudad: object, salario: float64, ...
¿Por qué esto es útil?
shape: Sabes cuántos datos tienescolumns: Verificas que las columnas se cargaron correctamentedtypes: Entiendes qué tipo de datos tienes (importante para operaciones matemáticas)
Ejemplo Práctico
# Leer un archivo CSV
df = pd.read_csv('datos.csv')
# Mostrar las primeras 5 filas
print("Primeras 5 filas:")
print(df.head())
# Mostrar información básica
print("\nInformación del DataFrame:")
print(df.info())
Consejos
- Siempre verifica los datos después de cargarlos
- Usa
head()para ver una muestra de los datos - Usa
info()para entender la estructura de los datos
Recursos Adicionales
Documentación Oficial
Bibliografía Recomendada
- Python for Data Analysis (Wes McKinney) - Creador de Pandas, guía completa
- Pandas in Action (Boris Paskhaver) - Guía práctica de Pandas
- Effective Pandas (Matt Harrison) - Mejores prácticas con Pandas
- Data Science from Scratch (Joel Grus) - Fundamentos de ciencia de datos
- Python Data Science Handbook (Jake VanderPlas) - Guía completa de herramientas de datos
Conceptos Relacionados
- Diccionarios y Sets - Base para entender DataFrames
- JSON - Trabaja con datos estructurados
- YAML - Otro formato de datos
Siguiente paso
Este es solo una introducción básica a Pandas. Para profundizar, consulta la documentación oficial o continúa con otros temas del curso como Herramientas Profesionales