Notas (35): troleadas de los «nihilistas estadísticos» del FT Alphaville y algunos asuntos más

TabICL es un «modelo fundacional» para datos tabulares capaz de predecir sin reentrenar mediante aprendizaje en contexto sobre filas de la tabla. Si hay IAs capaces de generar texto o imágenes, ¿por qué no columnas adicionales en una tabla, datos faltantes, etc.? Un diccionario estadística-ML para traducir de una a otra términos como «inferencia», «verosimilitud», «causal», «priori», «bayesiano» o «sesgo». La paradoja «todos los sitios se están calentando más deprisa que el resto del mundo», explicada: lo que menos se calienta es el mar, donde no vive nadie. ...

22 de septiembre de 2026 · Carlos J. Gil Bellosta

De cómo B, un individuo con segundas intenciones, engaña al agente racional A a pesar de saber que B está interesado en mentirle

Por fijar ideas, supongamos que: A es un aficionado al cine que decide pagar por ver una película si la probabilidad de que sea buena es del 50% o más. Solo el 30% de las películas son buenas. Así las cosas, en principio, A nunca iría al cine: sin otra información, la probabilidad de que una película sea buena es del 30%, por debajo de su umbral de decisión. Pero es que, además: ...

30 de julio de 2026 · Carlos J. Gil Bellosta

Notas (31): una serie de apuntes sobre estadística

Francisco Marcos cierra en Almacén de Derecho su serie sobre el cártel de la leche analizando las ocho sentencias de la Audiencia Provincial de Barcelona señalando cómo el juez rechazó las estimaciones de daños realizadas por ambas partes usando objetivísimos modelos macroeconómicos y prefirió evaluar su impacto, poco más o menos, por la cuenta de la vieja. Un episodio más que nos recuerda que la estadística es poco más que un recurso retórico. ...

28 de julio de 2026 · Carlos J. Gil Bellosta

Kepler y Bayes: charla en el PyData de Madrid el día 24 de junio

El día 24 de junio de 2026 doy una charla en el PyData de Madrid. El anuncio, que me ha llegado vía Guild, reza: PyData Madrid vuelve en junio para hablar de Python, Datos, Visualización, Inteligencia Artificial, ¡Y lo que surja! Nuestra última reunión antes del parón veraniego se realizará en las instalaciones de Informática del Ayuntamiento de Madrid (calle Albarracín 33), quienes generosamente nos ceden el espacio. Tendremos el placer de contar con tres charlas: ...

16 de junio de 2026 · Carlos J. Gil Bellosta

Pruebas A/B bayesianas: sobre la elección de una priori compatible con lo que cabe esperar de ella

No voy a robar el tiempo de nadie explicando qué es una prueba A/B. Diré solo que las voy a estudiar desde una perspectiva bayesiana y que voy a analizar críticamente la selección de las prioris. Por centrar ideas, supongo que la tasa de éxito a priori está alrededor del 5% y que mis prioris van a ser, en principio, betas: mu <- .05 sd <- .02 # cálculo de los parámetros de la beta correspondiente beta_params <- function(mu, sd) { var <- sd^2 tmp <- mu * (1 - mu) / var - 1 a <- mu * tmp b <- (1 - mu) * tmp c(a = a, b = b) } parms <- beta_params(mu, sd) print(parms) # a b # 5.8875 111.8625 Una elección estándar de las prioris sería considerar $A, B \sim \text{Beta}(a, b)$ independientes. Entonces cabe preguntarse si la distribución a priori es compatible o no con lo que se esperaría al observar datos. La respuesta es negativa. ...

30 de abril de 2026 · Carlos J. Gil Bellosta

Covid: ¿una o dos transmisiones a humanos?

Volveré al covid más abajo. Antes, propedéutica. Hay dos monedas, la A y la B. Alguien tira una de ellas 100 veces y obtiene 60 caras. Y la pregunta es: ¿qué moneda usó? Un indicador que nos permite razonar sobre qué moneda es más plausible es el factor de Bayes, es decir, la razón $$\frac{P(60/100 | A)}{P(60/100 | B)}$$ Para calcular $P(60/100 | X)$, lanzo la moneda $X$ $N \times 100$ veces, cuento el número de caras en cada una de las $N$ rachas de $100$ tiradas y calculo la proporción de casos en los que obtengo exactamente 60 caras. ...

23 de abril de 2026 · Carlos J. Gil Bellosta

Kepler ∩ Bayes

En los relatos acerca de las tribulaciones de los científicos se suele hacer referencia a estimaciones puntuales: X determinó que el Y era Z. Luego, además, se suele aclarar que ahora se sabe que el valor de Y no es Z sino tal vez el doble o un 10% menos. Pero ahí queda la cosa. Es extraño porque hoy en día, si todo el mundo piensa que Y es 0 y alguien propone un valor Z distinto, se lo ignora de no proporcionar un intervalo de confianza alrededor de Z que, entre otras cosas, excluya el 0. No está para nada claro que los astrónomos de la época tuviesen que hacer caso a pie juntillas a los Galileos, Keplers, etc. de la época. Con los estándares de hoy, no habrían podido publicar ninguno de sus resultados. ...

9 de abril de 2026 · Carlos J. Gil Bellosta

Teoría de la decisión bayesiana con NumPyro

Daniel Saunders tiene una entrada en su blog, A Bayesian decision theory workflow en el que utiliza PyTensor para resolver un problema de teoría de la decisión bayesiana (¿es realmente necesario el apellido?) y cuya solución es $3.291507977689139$. El maestro Juan Camilo Orduz —de quien no se puede dejar nunca de aprender— lo replicó en A Bayesian Decision Theory Workflow: Port to NumPyro para obtener $3.27928950$ como solución. Yo ahora recojo el guante y, por lo de bayesiano, llego a ...

25 de febrero de 2026 · Carlos J. Gil Bellosta

Notas (9): Algunos enlaces y comentarios sobre temas estadísticos

Mills ratio and tail thickness — John D. Cook nos habla de la razón de Mills ($\int_x^\infty f(t) dt / f(x)$) para estudiar el grosor de las colas de las distribuciones de probabilidad. Por ejemplo, aunque una distribución t con muchos grados de libertad es muy similar a una normal en la parte central, la razón de Mills las distingue claramente por su distinto comportamiento en las colas. What is “workflow” and why is it important? — Sobre el flujo de trabajo del análisis de datos (con inspiración bayesiana), según Andrew Gelman (y sus coautores). R Workflow es la reinterpretación de Frank Harrell del mismo asunto. ...

23 de febrero de 2026 · Carlos J. Gil Bellosta

Sobre un inesperado factor que convierte subrepticialmente una distribución a priori en informativa

La distribución predictiva a priori es la que se obtiene de un modelo a partir de las prioris, antes de ver datos o realizar ajustes. Se utiliza para evaluar el grado en que las prioris elegidas están dentro de rango y no generan datos que no se parecen en nada a los que se espera por conocimiento previo. El libro Bayesian Modeling and Computation in Python discute las distribuciones predictivas a priori en su segundo capítulo. Allí argumenta alrededor de dos ejemplos. El primero está elegido a propósito para defender el caso de las prioris informativas frente a las objeciones de sus innumerables escépticos. El segundo es más intrigante. Muestra el gráfico ...

18 de febrero de 2026 · Carlos J. Gil Bellosta