Curvas ROC no cóncavas: ¿por qué, por qué, por qué?

El otro día me enseñaron una rareza: una curva ROC no cóncava. Digamos que como El gráfico que la acompaña aquí, explica un par de cositas. El artículo enlazado discute cómo combinar clasificadores para construir otro cuya curva ROC sea la envolvente convexa del original.

13 de mayo de 2016 · Carlos J. Gil Bellosta

Tartas con porciones negativas

Aunque te pueda costar imaginarlas, existen: Están sacadas de la página de Red Eléctica (es que hoy he puesto una lavadora) y el gajo que sobresale a las diez es la aportación negativa de la conexión con las Baleares a sistema eléctrico peninsular: ¿Por qué —me pregunto— añadirán un uso de la electricidad en una gráfica que, según su título, corresponde a su generación? ¿Quién tuvo la idea de colocar un gajo negativo? ¿Quién tuvo la idea de utilizar tartas? ¿¡Quién, quién, quién!?

12 de mayo de 2016 · Carlos J. Gil Bellosta

Mañana (2016-05-12), caRtociudad en la reunión de usuarios de R de Madrid

Mañana día 12 de mayo (de 2016) Luz Frías, mi coautora, hablará de caRtociudad en la reunión de usuarios de R de Madrid. Es un paquete muy interesante para geolocalizar direcciones (¡sin las restricciones de los consabidos servicios!), identificar las secciones censales, distritos censales y códigos postales correspondientes a direcciones y ubicaciones, etc.

11 de mayo de 2016 · Carlos J. Gil Bellosta

Cartogramas rectangulares con R

Galería Paquete Y, lo siento, no tengo ejemplos míos. Pero si te animas, fabricas uno y lo enlazas en los comentarios, seguro que a alguien le sirve.

10 de mayo de 2016 · Carlos J. Gil Bellosta

Encuestas electorales: medios y sesgos (II)

Aquí quedó pendiente hablar de datos y métodos. Los primeros proceden de El Mundo. Solicité a Marta Ley, una coautora, los datos pero, antes de que contestase que sí (¡gracias!), me di cuenta de que podía obtenerlos solito: basta con capturar la llamada que el javascript local hace al servidor. ¿Métodos? Mejorables: se suaviza la intención de voto (con loess) y se estima la diferencia con un modelo de efectos mixtos, i.e., modelo<- lmer(delta ~ 1 + (1 | medio), data = misdatos) ¿Caveats? Veo dos: el primero, que loess suaviza teniendo en cuenta también observaciones futuras. Los autores de las encuestas no ven la verdad: solo los resultados de las encuestas previas. Debería haber usado como referencia la mejor predicción basada en observaciones pasadas. El segundo, que los porcentajes de los distintos partidos suman un total. Los sesgos no son independientes y yo los modelo como tales. ...

9 de mayo de 2016 · Carlos J. Gil Bellosta

Un corpus de textos en español para NLP

Mañana doy clase de NLP en el máster de ciencia de datos de KSchool. Para lo que necesito un corpus decente. Los hay en inglés a tutiplén, pero las hordas de lingüistas hispanoparlantes que se pagan los vicios a costa de tajadas de mi IRPF han sido incapaces de colgar ninguno en español que pueda ubicar y reutilizar. Necesito una colección de textos en español con ciertas características: Tener un cierto tamaño (¿unas cuantas centenas de ellos?) Que no sean demasiado grandes (¿unos cuantos párrafos?) Ser medianamente homogéneos. Estar bien escritos, sin faltas de ortografía, etc. Así que he decidido poner en valor otra de esas onerosas reliquias de la cultura analógica y de letras que es el Museo Thyssen; en particular, las descripciones que constan en las fichas de los cuadros. De hecho, corriendo esto: ...

6 de mayo de 2016 · Carlos J. Gil Bellosta

Encuestas electorales: medios y sesgos (I)

Existen las encuestas electorales. Las publican medios. Algunos, se dice, tienen sesgos. Lo he estudiado y a continuación muestro resultados. Para el PP: Para el PSOE: Para Podemos y cía: Para Ciudadanos: Para IU: En otra entrada, datos y métodos. Hoy solo adelanto que el eje horizontal mide puntos porcentuales y que las encuestas se remontan a enero de 2015.

5 de mayo de 2016 · Carlos J. Gil Bellosta

Transparencia, libertad y carcas (de antaño y hogaño)

Me cuenta Google que Hegel defendía eso de que la historia es el relato del desarrollo de la libertad humana (o algo parecido y en alemán). Y si algo ha de desarrollarse (y, además, al lento ritmo de la historia) en lugar de extenderse como las epidemias en esas pelis de catástrofes, es porque ha de vencer resistencias. Recuerdo las de antaño: no ha de confundirse libertad con libertinaje, un concepto que treinta años después sigo sin entender. Así nos decían los carcas allá por los ochenta. ...

4 de mayo de 2016 · Carlos J. Gil Bellosta

¡Haced click ya!

En esto.

3 de mayo de 2016 · Carlos J. Gil Bellosta

90 millones de euros en tecnologías del lenguaje

El gobierno español ha anunciado (ya hace un tiempo) un plan de impulso a las tecnologías del lenguaje con una dotación de 90 millones de euros (lo que costó el fichaje de Ronaldo). Veremos en unos años qué ha dado de sí la cosa. En particular, si habrá permitido que los usuarios de R dispongamos de herramientas libres (porque de momento, ya están cobrándonoslas vía Agencia Tributaria) para hacer nuestros cacharreos. O si, por contra, unos espabiladillos habrán sabido ordeñar la vaca con la excusa de desarrollar proyectos que acaben en una memoria que presentar en el ministerio de turno para justificar la subvención y unos zips en los discos duros de los ordenadores del fondo. Esas herramientas y proyectos, vamos, hechos a desgana y que, una vez cortado el chorro de la subvención, caen en el olvido. ...

29 de abril de 2016 · Carlos J. Gil Bellosta