1. ¿Qué es la ciencia de datos?
La ciencia de datos es, en esencia, el oficio de convertir datos en bruto —una tabla de ventas, un historial de precios, un conjunto de fotos— en algo útil: una explicación, una predicción o una decisión. El proceso típico tiene tres fases, y las tres están representadas en Don Claude:
- Limpieza y preparación — los datos reales casi nunca vienen listos: hay huecos, columnas de texto que un modelo no entiende directamente, escalas distintas entre variables.
- Modelado — aplicar un algoritmo que encuentra patrones en esos datos.
- Evaluación — comprobar si lo que el modelo "aprendió" realmente generaliza a datos que no ha visto, y no es solo memorización.
El machine learning (aprendizaje automático) es la parte de la ciencia de datos que se ocupa de los pasos 2 y 3: en vez de programar reglas a mano ("si la temperatura supera 30°, entonces…"), se le muestran ejemplos al algoritmo y este ajusta sus propios parámetros para acercarse al resultado correcto.
2. Aprendizaje supervisado vs. no supervisado
Esta es la distinción más importante en machine learning, y la que determina qué técnica te conviene usar sobre tus datos.
Hay una respuesta correcta de antemano
Existe una variable objetivo (lo que quieres predecir) y ejemplos donde ya se sabe la respuesta correcta. El modelo compara su predicción con la respuesta real y se corrige — como un estudiante con las respuestas del examen anterior.
Clasificación: la respuesta es una categoría (¿spam o no?).
Regresión: la respuesta es un número (¿cuánto costará?).
No hay respuestas, solo estructura por descubrir
No existe variable objetivo. El algoritmo busca agrupaciones o patrones por su cuenta, mirando solo cómo se parecen o difieren los datos entre sí — como ordenar una caja de fotos por similitud sin que nadie te diga según qué criterio.
¿Cómo sé cuál usar?
La pregunta clave es: ¿tengo una columna con la respuesta correcta para casos pasados, y quiero predecirla para casos nuevos? Si sí, es supervisado. Si lo que quieres es entender la forma de tus datos, agrupar casos parecidos o detectar anomalías sin una "respuesta correcta" predefinida, es no supervisado.
3. Un vistazo a las redes neuronales
Las redes neuronales no son una tercera categoría aparte: son una familia de algoritmos particularmente flexible que puede usarse tanto de forma supervisada como no supervisada, inspirada —de forma muy libre— en cómo se conectan las neuronas biológicas.
La unidad básica
Una neurona artificial hace algo simple: toma varios números de entrada, los combina con una suma ponderada (cada entrada multiplicada por un "peso" que indica su importancia), y pasa el resultado por una función de activación que decide cuánto "se activa". Una red es, literalmente, muchas de estas unidades conectadas en capas:
- Capa de entrada: recibe tus variables, una neurona por columna.
- Capas ocultas: combinan y recombinan esa información. Más capas y neuronas dan más capacidad para representar relaciones complejas — a cambio de necesitar más datos y más cuidado para no sobreajustar.
- Capa de salida: entrega la predicción.
Cómo aprende: descenso de gradiente y backpropagation
Al principio los pesos son aleatorios, así que las predicciones son básicamente ruido. Aprender consiste en repetir un ciclo:
- Forward pass: los datos atraviesan la red capa por capa hasta producir una predicción.
- Cálculo del error: se compara la predicción con el valor real.
- Backpropagation: el error se reparte hacia atrás, capa por capa, calculando cuánto contribuyó cada peso individual a ese error.
- Descenso de gradiente: cada peso se ajusta un poco en la dirección que reduciría el error, con un tamaño de paso llamado tasa de aprendizaje. Demasiado grande y el entrenamiento diverge; demasiado pequeño y tarda una eternidad.
Esto se repite miles de veces (cada repetición completa sobre los datos es una época) hasta que el error deja de bajar de forma significativa.
El módulo "Red profunda (desde cero)" de Don Claude implementa exactamente este ciclo con numpy puro, sin ninguna librería de deep learning de por medio — la forma más directa de ver el algoritmo trabajando, capa por capa. Incluye además momentumAdam como variantes más sofisticadas del último paso.
Sobreajuste, el enemigo común
Un modelo puede "memorizar" los datos de entrenamiento en vez de aprender el patrón general — funciona perfecto en lo que ya vio y mal en lo nuevo. Por eso siempre se separa un conjunto de test que el modelo no toca durante el entrenamiento, y a veces también uno de validación para elegir la configuración sin hacer trampa mirando el test de antemano. La regularización L2 (alpha) penaliza los pesos muy grandes, que son los que suelen hacer que un modelo extrapole mal.
4. Mapa rápido: módulo de Don Claude → concepto
| Módulo | Tipo | Idea central |
|---|---|---|
| Árbol de decisión | Supervisado | Reglas "si-entonces" aprendidas automáticamente, fáciles de leer. |
| K-Means | No supervisado | Agrupa filas parecidas en k grupos según distancia numérica. |
| Red neuronal supervisada (MLP) | Supervisado | Red neuronal clásica para clasificar o predecir un número. |
| Red neuronal no supervisada (autoencoder) | No supervisado | Comprime los datos a 2D para revelar su estructura sin etiquetas. |
| Extracción de patrones | No supervisado | Correlaciones/covarianzas: qué variables se mueven juntas. |
| Ecuación / regresión | Supervisado | Regresión lineal o logística con la fórmula explícita como resultado. |
| Red profunda (desde cero) | Supervisado | El mismo algoritmo de una red neuronal, implementado a mano para verlo por dentro. |
| Outliers (Isolation Forest) | No supervisado | Qué filas se comportan de forma anómala respecto al resto. |
| SVM | Supervisado | Busca el límite óptimo entre clases (o el mejor ajuste, en regresión). |
| Autocorrelación / ADF | Diagnóstico previo | Si una serie temporal tiene estructura predecible antes de modelarla. |
| CNN de imágenes | Supervisado | Clasifica imágenes completas por categoría. |
| Escaneo profundo en mosaico (retales.html) | Supervisado | Igual que la CNN, pero troceando cada imagen para no perder detalles pequeños. |
5. Para seguir profundizando
Esta guía se queda deliberadamente en la superficie. Si quieres ir más allá, busca estos términos con el nombre exacto que usa el framework: one-hot encoding, train/test split, validation set, silhouette score, softmax, ReLU, weight decay, Adam optimizer. Todos aparecen literalmente en el código y en las descripciones de cada módulo dentro de la propia interfaz.