Aún más sobre la falacia ecológica

I. Voy a retomar un hilo perdido en mi discusión del otro día sobre la falacia ecológica para abundar en una cuestión que tiende a obviarse a pesar de su gran importancia. En aquella entrada fusilé/usufructé el siguiente gráfico: En él se representan individuos (las elipses de colores) sobre los que hay medidas repetidas (las nubes de puntos que contienen) de cierto fenómeno cuantitativo. Lo relevante del gráfico es que: ...

2 de mayo de 2024 · Carlos J. Gil Bellosta

Más sobre la falacia ecológica

El de la falacia ecológica es un asunto que ya he tratado en alguna ocasión. Lo retomo porque he encontrado una exposición excelente sobre el concepto de la que esta entrada es prácticamente un plagio. Primero discute la historia del término. Se tiende a atribuir —yo también lo hice aquí— a W. S. Robinson en su artículo Ecological Correlations and the Behavior of Individuals. No obstante, parece que el término propiamente dicho es algo posterior: fue Hanan C. Selvin quien lo denominó falacia ecológica —con todas sus letras— en su artículo Durkheim’s Suicide and Problems of Empirical Research de 1958. Además, según la entrada que gloso, el concepto ya había sido tratado específicamente por E. L. Thorndike en su artículo de 1939 On the fallacy of imputing the correlations found for groups to the individuals or smaller groups composing them. No obstante, dada la ubicuidad de la falacia, apostaría bastante a que no costaría demasiado dar con otros precedentes (¿se puede decir precedentes previos sin que te riña Lázaro Carreter?). ...

30 de abril de 2024 · Carlos J. Gil Bellosta

Estadística: lo general y lo particular

No hay que perder de vista la etimología de la palabra estadística: viene de estado. La estadística es particularmente útil si eres el ministro de algo. Pero los más no lo somos. Los más nos enfrentamos a problemas como los que describo a continuación. 1. Cito de Gelman: Hay un conflicto entre dos principios de la medicina basada en evidencia: (1) la dependencia de estimaciones estadísticamente significativas de ensayos controlados y (2) la toma de decisiones para pacientes individuales. No hay forma de llegar al paso 2 sin ir más allá del paso 1. ...

18 de abril de 2024 · Carlos J. Gil Bellosta

Algunas notas sobre los CIs

I. Supongamos que $\theta$ es un parámetro real. John D. Cook le construye el siguiente intervalo de confianza al 95%: Se toma un dado de 20 caras (como los de rol). Si sale un 1, el intervalo de confianza es el conjunto vacío. Si sale cualquier otro valor, el intervalo de confianza es el eje real entero. Es tan perfectamente válido (desde el punto de vista frecuentista) como cualquier otro. II. La mejor manera que he encontrado para entender qué es un intervalo de confianza frecuentista es el de una urna enorme. ...

4 de abril de 2024 · Carlos J. Gil Bellosta

Las ANOVAs tienen interés meramente histórico

Todo eso que se conoce como ANOVA tiene, a lo más, interés histórico. Se puede hacer más y mejor con igual o menor esfuerzo. ¿Cómo? Aplicando lo que se cuenta aquí. Nota: Interés histórico no significa no interés: muchas veces existe un solapamiento importante entre el orden histórico de los conceptos y el orden en que es más natural aprenderlos (o enseñarlos).

2 de abril de 2024 · Carlos J. Gil Bellosta

¿Cómo se interpretan los resultados de estas regresiones

Esta entrada trata sobre las aparentes contradicciones que surgen cuando se comparan las regresiones $y \sim x$ y $x \sim y$. En particular, aquí se muestran y que vienen a decir: El tal Rodgers rinde por encima de lo que se espera para su salario. Para lo que rinde, gana demasiado. Lo cual, a pesar de lo contradictorio, no es un fenómeno extrañísimo. Si uno hace n <- 100 x <- rnorm(n) a <- .3 b <- .5 y <- a * x + b + 0.1 * rnorm(100) reg1 <- lm(y ~ x) reg2 <- lm(x ~ y) which.1 <- y > predict(reg1, data.frame(x = x)) which.2 <- x > predict(reg2, data.frame(y = y)) tmp <- cbind(which.1, which.2) tmp <- which(tmp[,1] & tmp[,2]) ab <- coef(reg2) plot(x, y) abline(reg1, col = "blue") abline(b = 1/ ab[2], a = - ab[1] / ab[2], col = "green") points(x[tmp], y[tmp], col = "red", pch = 16) puede obtener tantos gráficos de la forma ...

28 de marzo de 2024 · Carlos J. Gil Bellosta

Errores en modelos. Zillow. Control de alquileres.

I. Errores en modelos A menudo he usado plot(cars$speed, cars$dist) abline(lm(dist ~ speed, data = cars), col = "red") con el que se crea la requetemanida gráfica útil para ilustrar aspectos relacionados con el ajuste de modelos. Hoy, toca de nuevo. Salvo que uno haga cosas muy extravagantes, los errores de un modelo están tanto por arriba como por debajo de la predicción. De hecho, en una amplia clase de modelos $\sum_i e_i =0$ en entrenamiento y, usualmente, la suma de los errores no debe de quedar muy lejos de cero tampoco en validación (y en el mundo real). Uno puede casi siempre decir: unas veces me quedaré corto; otras, largo; pero la ley de los grandes números me da ciertas garantías de que lo dado compensará lo servido en el largo plazo. ...

7 de marzo de 2024 · Carlos J. Gil Bellosta

Los modelos bayesianos, ¿condenados a sobreajustar?

Por ese micromundo en el que me muevo, circuló recientemente una polémica sobre si los métodos bayesianos sobreajustan necesaria e irremisiblemente. El desencadenante fue la publicación Bayes is guaranteed to overfit, for any model, any prior, and every data point en la que el autor sostiene que, efectivamente: Tiene sentido hablar de sobreajuste en modelos bayesianos (a diferencia de lo que sostienen otros argumentando que, como los modelos bayesianos no maximizan ninguna función objetivo, no ha lugar siquiera a hablar de sobreajuste). Y que, efectivamente, sobreajustan. También reconoce, y eso hay que abonárselo, que otros métodos (MLE en particular) sobreajustan aún más. ...

5 de marzo de 2024 · Carlos J. Gil Bellosta

Probabilidad y banca

Traduzco y adapto un texto de Matt Levine (fuente), cuya relevancia para lo que aquí se suele tratar es más que evidente: […] el capital social de un banco, la participación de los accionistas, es solo una pequeña porción que descansa sobre un enorme iceberg de pasivos. En un banco conservador y rentable, podría haber 100€ de activos, 90€ de pasivos y, por lo tanto, 10€ de capital social. Los pasivos son ciertos y conocibles —cosas como depósitos, que deben pagarse al 100%—. Los activos son variables, tienen un riesgo y su valoración es un poco una suposición: incluye activos con precios sujetos a las variaciones del mercado, derivados extraños difíciles de valorar y préstamos comerciales con probabilidades inciertas de ser devueltos. El banco aplica algunas convenciones contables y hace algunas suposiciones para llegar a un valor de 100€ para sus activos. Pero ese número está rodeado de incertidumbre. ...

22 de febrero de 2024 · Carlos J. Gil Bellosta

Sobre el muy necesario "Rolling Journal of Sociology"

I. El ordenador —de sobremesa— con el que trabajo habitualmente está más cerca de los diez que de los cinco años. Desde que lo compré ha avanzado la tecnología y soy consciente de que uno nuevo podría facilitarme cierto tipo de tareas. Pero para el 99% de ellas, con lo que tengo, vale. Cambiar me costaría tiempo y dinero. Me da pereza. Realmente, puedo hacer todo lo que necesito con este i5-6400 de 64GB de RAM DDR3-2133. ...

20 de febrero de 2024 · Carlos J. Gil Bellosta