Don Claude — Ciencia de datos, ML y redes neuronales

Una introducción para quien llega atraído por el tema, sin formación técnica previa

← Volver a la herramienta
divulgativosupervisado vs no supervisado redes neuronalessin fórmulas innecesarias

1. ¿Qué es la ciencia de datos?

La ciencia de datos es, en esencia, el oficio de convertir datos en bruto —una tabla de ventas, un historial de precios, un conjunto de fotos— en algo útil: una explicación, una predicción o una decisión. El proceso típico tiene tres fases, y las tres están representadas en Don Claude:

  1. Limpieza y preparación — los datos reales casi nunca vienen listos: hay huecos, columnas de texto que un modelo no entiende directamente, escalas distintas entre variables.
  2. Modelado — aplicar un algoritmo que encuentra patrones en esos datos.
  3. Evaluación — comprobar si lo que el modelo "aprendió" realmente generaliza a datos que no ha visto, y no es solo memorización.

El machine learning (aprendizaje automático) es la parte de la ciencia de datos que se ocupa de los pasos 2 y 3: en vez de programar reglas a mano ("si la temperatura supera 30°, entonces…"), se le muestran ejemplos al algoritmo y este ajusta sus propios parámetros para acercarse al resultado correcto.

2. Aprendizaje supervisado vs. no supervisado

Esta es la distinción más importante en machine learning, y la que determina qué técnica te conviene usar sobre tus datos.

SUPERVISADO

Hay una respuesta correcta de antemano

Existe una variable objetivo (lo que quieres predecir) y ejemplos donde ya se sabe la respuesta correcta. El modelo compara su predicción con la respuesta real y se corrige — como un estudiante con las respuestas del examen anterior.

Clasificación: la respuesta es una categoría (¿spam o no?).
Regresión: la respuesta es un número (¿cuánto costará?).

NO SUPERVISADO

No hay respuestas, solo estructura por descubrir

No existe variable objetivo. El algoritmo busca agrupaciones o patrones por su cuenta, mirando solo cómo se parecen o difieren los datos entre sí — como ordenar una caja de fotos por similitud sin que nadie te diga según qué criterio.

¿Cómo sé cuál usar?

La pregunta clave es: ¿tengo una columna con la respuesta correcta para casos pasados, y quiero predecirla para casos nuevos? Si sí, es supervisado. Si lo que quieres es entender la forma de tus datos, agrupar casos parecidos o detectar anomalías sin una "respuesta correcta" predefinida, es no supervisado.

3. Un vistazo a las redes neuronales

Las redes neuronales no son una tercera categoría aparte: son una familia de algoritmos particularmente flexible que puede usarse tanto de forma supervisada como no supervisada, inspirada —de forma muy libre— en cómo se conectan las neuronas biológicas.

La unidad básica

Una neurona artificial hace algo simple: toma varios números de entrada, los combina con una suma ponderada (cada entrada multiplicada por un "peso" que indica su importancia), y pasa el resultado por una función de activación que decide cuánto "se activa". Una red es, literalmente, muchas de estas unidades conectadas en capas:

Cómo aprende: descenso de gradiente y backpropagation

Al principio los pesos son aleatorios, así que las predicciones son básicamente ruido. Aprender consiste en repetir un ciclo:

  1. Forward pass: los datos atraviesan la red capa por capa hasta producir una predicción.
  2. Cálculo del error: se compara la predicción con el valor real.
  3. Backpropagation: el error se reparte hacia atrás, capa por capa, calculando cuánto contribuyó cada peso individual a ese error.
  4. Descenso de gradiente: cada peso se ajusta un poco en la dirección que reduciría el error, con un tamaño de paso llamado tasa de aprendizaje. Demasiado grande y el entrenamiento diverge; demasiado pequeño y tarda una eternidad.

Esto se repite miles de veces (cada repetición completa sobre los datos es una época) hasta que el error deja de bajar de forma significativa.

El módulo "Red profunda (desde cero)" de Don Claude implementa exactamente este ciclo con numpy puro, sin ninguna librería de deep learning de por medio — la forma más directa de ver el algoritmo trabajando, capa por capa. Incluye además momentumAdam como variantes más sofisticadas del último paso.

Sobreajuste, el enemigo común

Un modelo puede "memorizar" los datos de entrenamiento en vez de aprender el patrón general — funciona perfecto en lo que ya vio y mal en lo nuevo. Por eso siempre se separa un conjunto de test que el modelo no toca durante el entrenamiento, y a veces también uno de validación para elegir la configuración sin hacer trampa mirando el test de antemano. La regularización L2 (alpha) penaliza los pesos muy grandes, que son los que suelen hacer que un modelo extrapole mal.

4. Mapa rápido: módulo de Don Claude → concepto

MóduloTipoIdea central
Árbol de decisiónSupervisadoReglas "si-entonces" aprendidas automáticamente, fáciles de leer.
K-MeansNo supervisadoAgrupa filas parecidas en k grupos según distancia numérica.
Red neuronal supervisada (MLP)SupervisadoRed neuronal clásica para clasificar o predecir un número.
Red neuronal no supervisada (autoencoder)No supervisadoComprime los datos a 2D para revelar su estructura sin etiquetas.
Extracción de patronesNo supervisadoCorrelaciones/covarianzas: qué variables se mueven juntas.
Ecuación / regresiónSupervisadoRegresión lineal o logística con la fórmula explícita como resultado.
Red profunda (desde cero)SupervisadoEl mismo algoritmo de una red neuronal, implementado a mano para verlo por dentro.
Outliers (Isolation Forest)No supervisadoQué filas se comportan de forma anómala respecto al resto.
SVMSupervisadoBusca el límite óptimo entre clases (o el mejor ajuste, en regresión).
Autocorrelación / ADFDiagnóstico previoSi una serie temporal tiene estructura predecible antes de modelarla.
CNN de imágenesSupervisadoClasifica imágenes completas por categoría.
Escaneo profundo en mosaico (retales.html)SupervisadoIgual que la CNN, pero troceando cada imagen para no perder detalles pequeños.

5. Para seguir profundizando

Esta guía se queda deliberadamente en la superficie. Si quieres ir más allá, busca estos términos con el nombre exacto que usa el framework: one-hot encoding, train/test split, validation set, silhouette score, softmax, ReLU, weight decay, Adam optimizer. Todos aparecen literalmente en el código y en las descripciones de cada módulo dentro de la propia interfaz.

← Volver a la herramienta y probarlo