Conviene haber comprendido Regresión lineal y diagnóstico.
Avanza en orden. Cada lección está redactada para Palta es Cool, utiliza ejemplos propios y termina con una actividad cuya respuesta puedes desplegar.
Ubícate antes de avanzar
Al terminar deberías poder relacionar Regresión logística con Predicción y resolver un caso nuevo.
Reserva entre 35 y 55 minutos para lectura, ejemplos, tres comprobaciones y cierre.
Instala R y luego RStudio. Conserva cada ejercicio en un proyecto separado.
Abrir la guía de herramientas →Diagnóstico rápido: ¿cómo se relacionan Regresión logística y Predicción? +
No necesitas acertar todavía. Escribe una hipótesis de dos líneas y compárala con tu respuesta al finalizar; si puedes corregirla y justificar el cambio, hubo aprendizaje.
Aprende el tema paso a paso
Extenderás el modelado a resultados binarios: entenderás probabilidades y odds, convertirás predicciones en decisiones y evaluarás discriminación, calibración y consecuencias.
- La regresión logística mantiene las probabilidades entre cero y uno
- El umbral expresa costos, no una ley universal
- Un modelo útil debe generalizar, calibrar y no dañar grupos
La regresión logística mantiene las probabilidades entre cero y uno
Cuando la respuesta tiene dos resultados, un modelo lineal puede predecir fuera del rango válido. La logística modela el logaritmo de las odds como combinación de predictores y transforma el resultado nuevamente en una probabilidad.
Probabilidad p: fracción esperada de resultados positivos.
Odds: p dividido por 1 menos p.
exp(coeficiente): cambio multiplicativo en las odds por unidad.
¿Una odds de 3 equivale a una probabilidad de 300 %?
Mostrar respuesta +
No. Las odds pueden superar uno. La probabilidad correspondiente es 3 / (1 + 3) = 0,75, es decir, 75 %.
El umbral expresa costos, no una ley universal
El modelo entrega probabilidades. Para clasificar se elige un umbral que produce verdaderos y falsos positivos y negativos. Sensibilidad y especificidad describen errores distintos; la calibración pregunta si probabilidades como 0,7 ocurren cerca de 70 % de las veces.
Sensibilidad: proporción de positivos detectados.
Especificidad: proporción de negativos correctamente descartados.
Umbral: decisión vinculada a costos y capacidad de intervención.
¿Por qué 0,5 no es siempre el mejor umbral?
Mostrar respuesta +
Porque no considera la prevalencia, los costos de cada error ni la capacidad operativa. El umbral debe justificarse con el uso real del modelo.
Un modelo útil debe generalizar, calibrar y no dañar grupos
Evaluar con los mismos datos del ajuste produce una visión optimista. Se separan entrenamiento y prueba o se usa validación cruzada. También se revisan fuga de información, cambios temporales y desempeño por grupos relevantes.
Generalización: rendimiento en datos realmente nuevos.
Fuga: predictor que contiene información futura o la respuesta.
Equidad: errores y cobertura pueden variar entre grupos.
¿Una exactitud de 95 % es buena si solo 5 % de los casos son positivos?
Mostrar respuesta +
No necesariamente. Predecir siempre “negativo” ya logra 95 % y no detecta ningún positivo. Se necesitan métricas por clase, calibración y una comparación con una línea base.
Tu recorrido en tres ideas
- La regresión logística mantiene las probabilidades entre cero y uno
- El umbral expresa costos, no una ley universal
- Un modelo útil debe generalizar, calibrar y no dañar grupos
Comprueba que puedes usarlo
Antes de continuar, revisa estos tropiezos frecuentes y resuelve un caso sin copiar los ejemplos.
Leer una razón de odds como si fuera una diferencia directa de probabilidades.
Evaluar el modelo en los datos de entrenamiento o incluir información futura.
Ahora hazlo sin guía
Crea una pauta para predecir abandono: ajuste logístico, probabilidades, umbral, matriz de errores y revisión por grupos.
Mostrar pauta de corrección +
- Interpreta coeficientes y probabilidades con un caso concreto.
- Justifica el umbral mediante costos y capacidad.
- Usa evaluación externa, calibración y métricas por clase o grupo.
