No es tanto sobre la media como sobre la maldición de la multidimensionalidad

El artículo que motiva esta entrada, When U.S. air force discovered the flaw of averages, no lo es tanto sobre la media como sobre la maldición de la multidimensionalidad. Podría pensarse que es una crítica a la teoría del hombre medio de Quetelet en tanto que niega la existencia de ese sujeto ideal. Pero lo que dice es una cosa sutilmente distinta: Using the size data he had gathered from 4,063 pilots, Daniels calculated the average of the 10 physical dimensions believed to be most relevant for design, including height, chest circumference and sleeve length. ...

9 de noviembre de 2020 · Carlos J. Gil Bellosta

Distancias (III): la gran pregunta

Dejemos atrás los puntos en el plano. Olvidemos al Sr. Gower. La gran pregunta a la que uno se enfrenta al construir una distancia es en términos de qué se espera proximidad entre sujetos. Y eso genera una cadena de subpreguntas del tipo: ¿Son más próximos un individuo y una individua de 33 años o una individua de 33 y otra de 45? Las dos entradas restantes de la serie (una sucia, rápida y práctica; la otra más especulativa) van sobre opciones disponibles para atacar (nótese que digo atacar y no resolver) el problema.

6 de noviembre de 2020 · Carlos J. Gil Bellosta

Distancias (II): las distancias no son distancias

Una distancia, Wikipedia dixit, sobre un conjunto $X$ es una función $d$ definida sobre $X \times X$ que toma valores en los reales $\ge 0$ y que cumple: $d(a,b) = 0 \iff a = b$ $d(a,b) = d(b,a)$ $d(a,c) \le d(a, b) + d(b, c)$ En la práctica, sin embargo, he encontrado violaciones tanto de (1) como de (2). ¿A alguien se le ocurren ejemplos? Sin embargo, (3) se mantiene. Sin (3) todo se volvería una locura. De hecho, obtener resultados razonables usando distancias significa particularmente que esas distancias cumplen (3). ...

3 de noviembre de 2020 · Carlos J. Gil Bellosta

Distancias (I): el planteamiento del problema

Me han pedido (vía Twitter) que desarrolle cosas que tengo por ahí desperdigadas (p.e., en las notas de esos cursos que ya no daré y puede que en algunas entradas viejunas de este blog) sobre distancias. ¿Por qué son importantes las distancias? Por un principio que no suele ser explicitado tanto como merece en ciencia de datos: si quieres saber algo sobre un sujeto, busca unos cuantos parecidos y razona sobre ellos. ...

2 de noviembre de 2020 · Carlos J. Gil Bellosta

Qué métodos estadísticos utilizar si el pan de tus hijos depende de que las p sean pequeñajas

Según Methods Matter: P-Hacking and Publication Bias in Causal Analysis in Economics, las variables instrumentales (para estas, en particular, véase esto) y las diferencias en diferencias: Applying multiple approaches to over 21,000 hypothesis tests published in 25 leading economics journals we find that the extent of p-hacking and publication bias varies greatly by method. IV (and to a lesser extent DID) are particularly problematic. Es curioso que se estudie también la regresión con discontinuidades y que no acabe en el podio. Sospecho que es tan cantosa que no pasa los filtros de los editores y revisores.

28 de octubre de 2020 · Carlos J. Gil Bellosta

Intervalos de confianza y la velocidad de la luz

La interpretación puramente frecuentista de los intervalos de confianza es que el 95% de ellos contendrán el valor de interés en cuestión. Veamos qué nos cuenta al respecto la historia de la medición de la velocidad de la luz contemplada a través de la lectura de Determining the Speed of Light (1676-1983): An Internalist Study in the Sociology of Science primero en forma tabular (nota: en la fuente original hay una tabla más extensa de la que esta es resumen), ...

26 de octubre de 2020 · Carlos J. Gil Bellosta

Corrección en mi entrada "Comentarios varios sobre un artículo de El País sobre MOMO"

[Esta es una] Breve nota para difundir la corrección que he realizado en mi entrada del viernes.

25 de octubre de 2020 · Carlos J. Gil Bellosta

Comentarios varios sobre un artículo de El País sobre MOMO

[Esta entrada ha sido enmendada con respecto a cómo fue publicada originalmente por los motivos que abajo se indican.] El artículo es El Instituto de Salud Carlos III subestima las muertes de la segunda ola y los comentarios, estos: El artículo trata un tema conocido de muchos, la infraestimación que hace el actual sistema MOMO de los excesos de mortalidad y cuyos motivos comenté extensamente el otro día. Dice, muy acertadamente: ...

23 de octubre de 2020 · Carlos J. Gil Bellosta

¿Modelos para ordenar datos?

Ayer leí este resumen de este artículo que propone y discute un algoritmo novedoso y basado en ciencia de datos para ordenar datos y hacerle la competencia a quicksort y demás. Reza y promete: The results show that our approach yields an average 3.38x performance improvement over C++ STL sort, which is an optimized Quicksort hybrid, 1.49x improvement over sequential Radix Sort, and 5.54x improvement over a C++ implementation of Timsort, which is the default sorting function for Java and Python. ...

22 de octubre de 2020 · Carlos J. Gil Bellosta

z-scores, p-scores y el problema de las áreas pequeñas

Uno de los problemas que encuentra uno al monitorizar series temporales en diversas escalas es el de encontrar una métrica de desviaciones de la normalidad (al menos en tanto que los sectores en los que trabajo no se pueblen de postmodernistas que comiencen a cuestionar qué es eso de la normalidad y a argumentar que si es un constructo tan injusto como inasequible) que cumpla una serie de requisitos: El primero y fundamental, que detecte efectivamente desviaciones de la normalidad. Que sea interpretable. Que permita la comparación entre distintas series. Estoy tentado a volver sobre el asunto de la mortalidad y de MOMO para ilustrarlo. Porque en proyectos de esa naturaleza hay que construir una métrica que nos diga si es igual de relevante (o de indicador de problemas subyacentes serios) un incremento de 20 defunciones en Madrid o de 2 en Teruel. ...

21 de octubre de 2020 · Carlos J. Gil Bellosta