1. Elige el tipo de modelo
2. Añade datos
Datasets de ejemplo
3. Lienzo
Haz clic en el lienzo para añadir un punto. Mínimo 2 puntos para entrenar.
Cargando aplicación...
Preparando tu experiencia meskeIA
Añade puntos al plano y observa cómo el modelo se ajusta en tiempo real. Compara OLS analítico con descenso de gradiente animado.
Haz clic en el lienzo para añadir un punto. Mínimo 2 puntos para entrenar.
Lineal, polinómica y logística
| Modelo | Fórmula | Métrica clave | Cuándo usarlo | Supuesto principal |
|---|---|---|---|---|
| Lineal simple | y = a·x + b | R², MSE | Relación recta entre variables continuas | Errores normales, varianza constante |
| Lineal múltiple | y = w·x + b (vectorial) | R², MSE ajustado | Varias variables explicativas | No multicolinealidad fuerte |
| Polinómica | y = c0 + c1·x + ... + cn·x^n | R², MSE en validación | Curva no lineal continua | Riesgo de sobreajuste con grado alto |
| Logística | P(y=1) = σ(w·x + b) | Accuracy, precision, recall, AUC | Clasificación binaria | Linealidad de log-odds |
| Ridge / Lasso | Lineal + penalización L1/L2 | R² en validación cruzada | Muchas variables o multicolinealidad | Hiperparámetro λ por validación |
Aprendes los fundamentos de aprendizaje supervisado: añade puntos, cambia entre OLS y gradiente, y observa cómo varían los coeficientes. Es la práctica básica antes de pasar a redes neuronales.
Empieza con el dataset «Lineal con ruido» y compara métodos.
Una regresión lineal estima precio en función de variables (m², habitaciones, antigüedad). Aquí ves la versión 1D para entender la idea antes de usar varias variables.
Un R² alto no garantiza utilidad: revisa siempre los residuos.
Aprobado / suspenso, spam / no spam, enfermo / sano. La regresión logística da una probabilidad y dibuja una frontera de decisión. Punto de partida obligatorio en cualquier curso de ML.
Prueba el preset «Clases con solape» para ver fronteras imperfectas.
Muestra en clase qué pasa al subir el grado del polinomio: con grado 1 hay sesgo, con grado 5 hay sobreajuste. Demostración visual del compromiso sesgo-varianza.
El aumento de R² al subir el grado es un caso clásico de overfitting.
La regresión predice un valor numérico continuo (precio, temperatura, salario). La clasificación predice una categoría discreta (spam / no spam). La regresión logística predice probabilidad y luego se umbraliza para clasificar.
R² es la proporción de varianza explicada por el modelo. R² = 1 significa ajuste perfecto, R² = 0 que el modelo no explica nada (como predecir siempre la media). Valores típicos:
Ciencias físicas: >0,9 esperable. Ciencias sociales: 0,3-0,6 ya es útil. R² negativo indica que el modelo es peor que predecir la media.
OLS analítico (mínimos cuadrados ordinarios) tiene solución cerrada en regresión lineal: rápida y exacta. Gradiente es necesario cuando:
Datasets enormes que no caben en memoria, modelos no lineales como logística o redes neuronales, o cuando quieres regularización compleja. En lineal pequeño, OLS siempre es mejor.
Un polinomio de grado n con n+1 puntos pasa por todos los puntos (interpolación exacta) pero su comportamiento entre puntos es caótico. R² en entrenamiento es perfecto, pero la predicción en datos nuevos es horrible.
Solución: validación cruzada, regularización (Ridge / Lasso) o elegir el grado más bajo que dé un ajuste razonable.
La sigmoide σ(z) = 1/(1+e^-z) transforma cualquier número real en un valor entre 0 y 1, ideal para representar probabilidades. Pasa por (0; 0,5), tiene forma de S y derivada simple σ'(z) = σ(z)·(1−σ(z)).
No. La logística no tiene solución cerrada porque la función de pérdida (log-loss) no es cuadrática. Se usa siempre descenso de gradiente o métodos iterativos como Newton-Raphson (IRLS). Por eso este simulador fija gradiente cuando eliges Logística.
Antes de elegir el modelo, mira si la nube de puntos parece lineal, curva o forma 2 grupos separados. Eso te dice si necesitas lineal, polinómica o logística.
Empieza por lineal. Solo sube a polinómica o logística cuando veas que el residuo tiene un patrón claro (no aleatorio) o que hay grupos que clasificar.
R² para regresión, accuracy y F1 para clasificación. Pero no te quedes solo con un número: visualiza la curva ajustada para detectar problemas que las métricas ocultan.
Si los residuos tienen patrón (forma de U, embudo...), el modelo es incorrecto. Residuos aleatorios alrededor de cero indican ajuste razonable.
Un modelo que funciona en entrenamiento pero falla en datos nuevos está sobreajustado. Divide siempre en train / test o usa validación cruzada.
Un scatter plot en 5 segundos te ahorra horas. Detectarás outliers, relaciones no lineales y agrupamientos imposibles de ver con métricas.
Si una variable va de 0 a 1 y otra de 0 a 1.000.000, el gradiente se vuelve inestable. Estandariza (media 0, desviación 1) antes de entrenar con gradiente.
Demasiado alta → diverge (la pérdida explota). Demasiado baja → tarda eras en converger. Empieza con 0,01 o 0,05 y ajusta según veas la curva de pérdida.
Ridge (L2) y Lasso (L1) penalizan coeficientes grandes y previenen sobreajuste. Lasso también selecciona variables (las pone a cero).
k-fold CV (típico k=5 o k=10) da una estimación robusta del error real. Un único split puede engañarte por azar.
Antes de presumir de modelo, compara con el más simple posible: predecir la media (regresión) o la clase mayoritaria (clasificación). Si no superas ese baseline, algo va mal.