La ciencia de datos es una disciplina central dentro del ecosistema tecnológico. Con la irrupción de la inteligencia artificial generativa y el acceso masivo a herramientas de machine learning, entender los fundamentos del análisis de datos es más relevante que nunca.
No se trata solo de entrenar modelos, sino de saber preparar los datos, interpretar los resultados y tomar decisiones informadas en cada etapa del proceso.
El Libro Vivo de Ciencia de Datos 2da edición en Python llega como una actualización de una obra que ya acumula más de 500 mil visitas en su versión web y fue premiada por RStudio. Su autor, Pablo Casas, reúne más de 15 años de experiencia como científico de datos para ofrecer un enfoque práctico y directo sobre lo que realmente importa al trabajar con datos.
Introducción al libro
Este libro está pensado para quienes quieren entender el ciclo completo de un proyecto de datos: desde que recibes un conjunto de datos crudo hasta que evalúas el desempeño de un modelo predictivo. No es un manual teórico de estadística ni una guía superficial de machine learning. Se enfoca en las etapas críticas que determinan el éxito o fracaso de un proyecto: el análisis exploratorio, la preparación de datos, la selección de variables y la evaluación de modelos.
Está dirigido a científicos de datos, analistas, ingenieros de IA, programadores y estudiantes que ya tienen nociones básicas de Python y quieren desarrollar una intuición sólida sobre cómo funcionan los datos en la práctica. El código está diseñado para poder copiarse y ejecutarse, con explicaciones que priorizan la comprensión conceptual sobre la fórmula matemática.
Contenido del libro
La obra cubre cuatro áreas fundamentales de la ciencia de datos aplicada. Primero, el análisis exploratorio de datos, donde se aprende a diagnosticar la salud de un conjunto de datos usando métricas como valores faltantes, ceros, tipos de datos y distribuciones. Segundo, la preparación de datos, que incluye manejo de tipos de datos, variables de alta cardinalidad, tratamiento de valores atípicos, imputación de datos faltantes y discretización.
Tercero, la selección de las mejores variables, un tema crucial que muchos libros pasan por alto pero que determina la calidad del modelo final. Cuarto, la evaluación del desempeño de un modelo, donde se analizan métricas como matriz de confusión, curva ROC, sensibilidad y especificidad. Todo el código utiliza Python con bibliotecas como pandas, scikit-learn, matplotlib, seaborn y funpymodeling.
Índice del libro
- Prefacio
- Análisis exploratorio de datos
- Análisis numérico: estado de salud de un dataset
- Análisis de variables categóricas y numéricas
- Correlación y relación: correlación lineal, MIC, Teoría de la Información
- Preparación de datos
- Tipos de datos y conversiones
- Variables de alta cardinalidad (estadística descriptiva y modelado predictivo)
- Tratamiento de valores atípicos
- Datos faltantes: análisis, manejo e imputación
- Consideraciones de tiempo
- Selección de las mejores variables
- Evaluar el desempeño de un modelo
- Matriz de confusión, exactitud, sensibilidad, especificidad
- Curva ROC y punto de corte óptimo
- K-fold cross validation
- Kappa estadístico
- Apéndice: La magia de los percentiles
Datos del libro
- Título: Libro Vivo de Ciencia de Datos, 2da ed. Python
- Autor: Pablo Casas
- Año de publicación: 2026
- Editorial: Autopublicado
- Páginas: 240
- Tiempo de lectura estimado: ~6 h
- Nivel: Principiante a intermedio
- Categoría principal: Ciencia de datos
- Subcategoría: Análisis de datos
- Idioma: Español
- Licencia: Creative Commons Atribución-NoComercial-CompartirIgual 4.0 Internacional (CC BY-NC-SA 4.0)
Más libros en: Análisis de datos, Ciencia de datos
Aviso legal: Este libro se comparte únicamente con fines educativos. El contenido se distribuye bajo licencias Creative Commons o permisos explícitos de sus autores. OpenLibro no aloja material con derechos reservados.