Carlos J. Gil Bellosta

Ayer estuve disfrutando como un enano leyendo On the Mathematical Foundations of Theoretical Statistics del nunca suficientemente encarecido Sir Ronald Fisher. Y me fijé que fue publicado en 1922. En él se cita —y nada elogiosamente, hay que decirlo— el A Treatise on Probability de Keynes, que fue, a su vez, publicado en 1921.

Aquellas cosas que constituyen el temario de las oposiciones al INE se estaban escribiendo hace cien años. Solo que de una manera muy amena, con pullas, con reconocimientos explícitos de que, bueno, se hacen las cosas así porque no tenemos potencial de cálculo suficiente para hacerlas de otra manera —esas cosas que hoy hacemos como en 1922 no porque ya no podamos hacerlas de otra manera sino porque se dejaron así escritas entonces—, que usamos tales distribuciones y no otras porque están tabuladas, etc.

I. El experimento mental

Tienes una variable binaria y y 100 variables predictoras de las cuales 99 son puro ruido y la última es igual a y. En código,

n <- 1000
y <- as.factor(rbinom(n, 1, .4))
x <- matrix(rnorm(n*100), n, 100)
x[,100] <- y

El objetivo consiste, obviamente, en predecir y en función de x.

II. RRFF

Los RRFF, como es bien sabido, son conjuntos de n árboles construidos sobre los mismos datos. La predicción final se realiza por consenso. Obviamente, si todos los árboles se construyen sobre las mismas filas y las mismas columnas, el resultado es equivalente a construir un único árbol. Por eso, aleatorizan. Aleatorizan filas y columnas. Voy a obviar el asunto de las filas y me voy a concentrar en el de las columnas.

IBM ha desarrollado una iniciativa, Uncertainty Quantification 360, que describe así:

Uncertainty quantification (UQ) gives AI the ability to express that it is unsure, adding critical transparency for the safe deployment and use of AI. This extensible open source toolkit can help you estimate, communicate and use uncertainty in machine learning model predictions through an AI application lifecyle. We invite you to use it and improve it.

En la página del proyecto hay documentación abundante pero recomiendo comenzar por la demo.

Son muy infrecuentes, lo admito. Pero cuando ocurren, le dan a uno ganas de poner los pies encima la mesa y fumarse un puro.

¿Qué son? Imagina que te pasan unos datos con el objetivo de realizar determinadas predicciones. Creas un modelo razonable —hasta bueno, dirías—, basado en primeros principios y que funciona bastante bien… excepto en unos cuantos casos irreductibles (sí, como aquellos galos de su aldea). Compruebas el modelo una y mil veces y no le ves problemas significativos; revisas los datos de nuevo, especialmente en esos casos en los que el modelo falla, y parecen tener sentido.

No suelo recomendar cursos de estadística de otros en estas páginas, pero haré una excepción con el de Antonio José Pou y Ordinas por varias razones, siendo la de más peso entre todas ellas que fue publicado en 1889.

Puede consultarse aquí.

Previo:

Hoy he oído el término dudacionista (de la vacuna) por primera vez. Me parece, por lo que contaré después, mucho más apropiado —y en otros que también aclararé, mucho menos— que negacionista para muchos de los casos que conozco.
Varios dudacionistas me han preguntado sobre mi opinión sobre su postura. Por referencia (mía y suya) y para poder contestar a los que vengan con una url, escribo lo que sigue.
Escribí una entrada hace un tiempo, esta, en el que esbozaba una postura comprensiva hacia los dudacionistas en las primeras fases de la vacunación en el que argumentaba alrededor del principio de precaución (esencialmente).
Entonces no, pero ahora ya sí tengo mis dos dosis preceptivas de la vacuna.

Tras lo cual, comienzo.

[Menos mal que se me ha ocurrido buscar en mi propio blog sobre el asunto y descubrir —no lo recordaba— que ya había tratado el asunto previamente en entradas como esta, esta o esta.]

El problema de la propagación de errores lo cuentan muy bien Iñaki Úcar y sus coautores aquí. Por resumirlo: tienes una cantidad, $latex X$ conocida solo aproximadamente —en concreto, con cierto error— e interesa conocer y acotar el error de una expresión $latex f(X)$.

[Esta entrada recoge una serie de notas y reflexiones sobre el asunto del título desgajadas de un proyecto de vídeo que vengo posponiendo varias semanas y que toca el asunto semitangencialmente.]

I.

En muchas disciplinas científicas (y no solo científicas: también, por ejemplo, en la dialéctica de Marx y Engels) existen unos resultados que por algún motivo se conocen tradicionalmente como leyes (p.e., la de la gravitación universal). Haciendo una enumeración rápida de algunas que me saltan a la memoria, constato que ninguna de ellas deja de ser una observación empírica. Al menos, en su origen.

He publicado esto en Youtube:

Igual no lo debería haber hecho. Trata del manido tema “alguien ha publicado un artículo científico con serios errores metodológicos”. Que es una versión del más popular

(No hace falta que indique la fuente, ¿verdad? Sabéis que sé que sabéis de dónde lo he sacado, ¿no?)

He osado publicar un nuevo vídeo en Youtube sobre el asunto que llenó las portadas de los periódicos ayer: la regla de tres. Puede verse aquí:

¿Una nueva afición para los próximos 10-15 años?

¿Cómo aleatorizan las columnas los RRFF?: un experimento mental y una coda histórica

Cuantificación de la incertidumbre

Esos felices "momentos Le Verrier"

Un curso de estadística de Antonio José Pou y Ordinas muy recomendable

En respuesta a los "dudacionistas" de la vacuna que me preguntaron, preguntan o preguntarán

Aún más sobre propagación de errores (y rv)

Sobre la economía conductual

Nuevo vídeo en YouTube: un artículo y tres problemas metodológicos

Nuevo vídeo en YouTube: sobre la regla de tres (en particular) y sobre la educación en España (en general)