Material propio sobre ingeniería de datos: de los fundamentos
de bases de datos a Big Data, orquestación y BI. Escrito desde el trabajo real.
10 manuales · 8 disponibles
Cómo leer esta serie
Estos manuales no son diez textos sueltos: son un
recorrido. Empiezan en lo más básico (qué es una base de datos) y llegan
hasta mover y transformar datos en un data warehouse real. Cada uno sale
de trabajo en producción y, cuando hay práctica, se hace sobre un entorno
que podés armar vos.
No todo es una fila recta: algunos manuales dependen
de otros y otros se leen cuando quieras. Por eso hay tres líneas.
00 → 01 → 02 → 03 → 04 → 09
Línea Teradata
Conviene arrancar por Base de Datos y SQL, aunque Teradata no los
exige. Después viene Teradata y su dataset de e-commerce; luego Data
Warehouse y Modelado Dimensional, que trabajan sobre esas mismas
tablas; y al final DataStage, que mueve y transforma esos datos. Acá
el orden importa: cada manual reutiliza lo que armaste en el
anterior.
05 → 06
Línea distribuida
Hadoop tiene su propio entorno (Cloudera en una VM) y no depende de
lo anterior. Big Data es el paraguas conceptual que ordena toda la
serie, y se disfruta más con el resto ya leído.
07 · 08
Sueltos
Business Intelligence y Control-M se leen en cualquier momento.
Control-M pega mejor después de DataStage, pero no lo necesita.
Con ejercicios y sin ejercicios. Los
manuales 02, 03, 04, 05 y 09 traen práctica (Teradata o la VM de
Hadoop). Big Data, BI y Control-M son de lectura: Control-M es una
herramienta paga y no hay un entorno de práctica abierto. Si recién
empezás, andá por el 00; si ya sabés SQL, saltá al 02.