Etiquetas

Estadística (17) 2Bachillerato (14) bachillerato (14) 4eso (13) probabilidad (10) 1bachillerato (9) CoVid19 (8) 2eso (7) economía (7) elecciones (6) 3eso (5) democracia (5) desigualdad (5) desviación típica (5) física (5) Porcentajes (4) ciencia (4) ley d'Hont (4) media (4) encuesta (3) error (3) física teórica (3) geometría (3) gráficas (3) relatividad (3) sucesión (3) Darwin (2) Examen (2) Madrid (2) astronomía (2) clase social (2) educación (2) exponencial (2) exposición (2) fisica cuantica (2) funciones (2) gráfica (2) historia (2) lotería (2) matemáticas CCSS (2) politica (2) proporcionalidad (2) sesgo (2) Alejandría. biblioteca (1) Bayes (1) Constitución (1) CosmoCaixa (1) Crack 29 (1) Gagarin (1) Gini (1) Hipatia (1) Hoover (1) Noether (1) Número irracional (1) PAU (1) Porcentajes encadenados (1) Queen (1) Renta per capita (1) Tales de Mileto (1) actividad (1) agujero negro (1) algoritmos (1) calendario (1) cambio climático (1) diagrama de barras (1) diagrama de sectores (1) día del libro (1) ecología (1) ecuaciones (1) elipse (1) evolución (1) extremo relativo (1) fracción (1) frecuencia (1) globalización (1) gravitación (1) gregoriano (1) hipercubo (1) impuesto (1) inecuaciones (1) inicio (1) interpolación (1) juliano (1) matemáticas financieras (1) media aritmética (1) media geométrica (1) mediana (1) meteorología (1) museo (1) máximo (1) mínimo (1) música (1) número normal (1) número trascendente (1) ondas (1) ondas gravitatorias (1) paradoja (1) pobreza (1) polinomios (1) política fiscal (1) porcentaje (1) profecía autocumplida (1) punto de inflexión (1) rango (1) riqueza (1) salario (1) simetría (1) solución (1) tabla (1) taller (1) talleres (1) valor medio (1) álgebra (1)
Mostrando entradas con la etiqueta error. Mostrar todas las entradas
Mostrando entradas con la etiqueta error. Mostrar todas las entradas

miércoles, 8 de abril de 2020

Respuesta a la pregunta "¿una muestra de 60.000 test es fiable?"

En la rueda de prensa que ofreció el ministro de Sanidad S. Illa el martes 7 de abril un periodista preguntó si un muestreo de 60.000 test permitiría realmente estimar cuánta población puede estar afectada por el CoVid19. La respuesta es que sí es una muestra con fiabilidad estadística según dijo el ministro a partir de lo que le comentaron los técnicos.

¿Qué significa eso? Como sabe el alumnado de 2º Bachillerato de matemáticas de CCSS en estadística es posible calcular el margen de error en las predicciones sobre la población general realizadas a partir de una muestra más pequeña con una cierta probabilidad. La fórmula es:



Donde z, llamado valor crítico, es un número que depende de la probabilidad de acierto que queramos, por ejemplo, para un 99%   z = 2,575. En estos casos se suele hablar de una confianza del 99%. n es el tamaño de la muestra (n = 60.000) y p es el porcentaje de población que dará positivo en la muestra, como todavía no lo conocemos se escoge para p = 0,5 que nos da el error mayor.



Esto quiere decir que la diferencia entre el porcentaje de positivos obtenidos en el muestreo con el porcentaje de la población general será inferior a 0,5 en el 99% de las ocasiones. Seguramente en los cálculos reales se hallan usado un valor de z para una confianza mayor que 99%.

En todo caso esto es otra muestra de la ignorancia que existe entre el público en general sobre la manera de calcular los márgenes de error en las encuestas, no solo en esta, sino en otras muchas que aparecen en los periódicos sobre elecciones o popularidad, y en las que por desgracia solo se habla del porcentaje obenido sin entrar enla importante cuestión del error admitido. Por cierto en las encuestas que se hacen en los periódicos, el tamaño de la muestra no pasa de 2000 casos y el error admitido es mucho mayor.

IMPORTANTE: el muestreo debe ser aleatorio y sin sesgo. NO se pueden escoger para un muestreo los test de la misma forma que si queremos hacer diagnósticos.

sábado, 5 de agosto de 2017

El error de CIS

¿El error del CIS?  ¿Algo relacionado con la interpretación?

Sobre la interpretación de estos datos como lo acertado o no de las estrategías de Pedro Sánchez con su giro a l aizquierda o de Unidos Podemos con su moción no diré nad porque ya hay mucha gente y medios hablando de ello. Entonces, ¿dónde está el error del CIS? Pues eso, ¿Dónde está?

Todos los sondeos y su tratamiento estadístico tienen un par de datos muy importantes que no siempre parecen publicados. Por un lado, las técnicas de muestreo que nos indican  como de protegidos estamos contra el sesgo, y el error asociado a utilizar muestras de un tamaños razonable y pequeño en lugar de todo el censo. Y son impotantes porque las cantidades medias (de porcentaje de voto) si los analizamos a lo largo del tiempo nos pueden indicar tendencias (algo muy importante para interpretar los datos) pero en una foto instantánea sin conocer entre que vlores se mueve realmente la media, a veces no se puede llegar a conclusiones sólidas sino a ambigüedades. En este caso estamos de enhorabuena y de los tres periódicos que he ojeado hasta el momento dos nos dan todos estos datos, El diario en una ficha técnica completa y El Pais en un párrafo al final del artículo, y el tercero en discordía, El Mundo también lo da aunque un poco escondido en la 3ª página de un documento pdf de 35 páginas, adjunto a la noticia (al igual que OkDiario y ABC).

El diario
El País
El Mundo (noticia)
Pdf adjunto a la noticia de El Mundo
La Vangurdia
okdiario
El economista
ABC
La Razón

jueves, 9 de mayo de 2013

El sesgo, ¿es el nombre de un ogro?

Una nueva entrada sobre ... ¡estadística! ¡Qué sorpresa! En este caso tratamos con algo de nombre casi tan oscuro y feo como su significado: el sesgo estadístico.

En muchas ocasiones es necesario seleccionar unos cuántos datos  en un estudio estadístico, pero en cualquier caso esta selección debe ser explicita, objetiva y  estar justificada. Si esta selección no está bien hecha o no es conocida puede introducir "preferencias" que desvirtúe las conclusiones.

En ocasiones el sesgo es simplemente un error, una negligencia inconsciente como tantas otras. A veces, es una selección consciente que depende de la conclusión que se quiera "demostrar" y esta de quién pague el estudio estadístico, algo parecido a un delito de lesa matemática. Por desgracia, no siempre es fácil distinguir un caso del otro.

Veamos primero un ejemplo ya tradicional con resultado conocido. La primera encuesta electoral telefónica de la historia se realizó en 1933 en EEUU. En esa encuesta se predecía una victoria del candidato republicano Hoover (candidato a la reelección), sin embargo ganó Roosevelt de manera aplastante, lo que conllevo la aplicación de la política económica del New Deal para luchar con la depresión del 29, contraria a la realizada hasta ese momento por el presidente Hoover. ¿Hay alguna explicación para este error? Sí, se produjo un claro sesgo, se pregunto mayoritariamente a votantes del partido republicano. Y como pista insisto en que la encuesta fue telefónica.

Respuesta: Muy fácil. Estamos en 1933, tras 4 años de Gran Depresión y medidas económicas equivocadas (estilo austericidio). Los teléfonos no eran baratos, por tanto, el hacer una encuesta telefónica en esa época era introducir un sesgo basado en la clase social a la que pertenecía el encuestado. No quedaba reflejada la opinión del 100% de la población, sino solo de los más ricos.

Ahora veremos un caso más reciente. En este artículo La escuela concertada refuerza los recursos por alumno en la pública se usan datos del ministerio de educación, sin facilitar las fuentes por desgracia, para concluir que las autonomías en las que el porcentaje de colegios privados y concertados es mayor  coinciden con las que gastan más en educación pública. Curiosamente para demostrar esto se escogen datos solo de 10 autonomías, y no de las 17 ¿Por qué? No parece que haya ninguna explicación.

En términos estadísticos lo que pretende probar esto es que existe una correlación entre el porcentaje en concertada y la inversión en pública, es decir a mayor porcentaje de una, mayor inversión en la otra. Si se representase en una gráfica veríamos una línea recta que sube de izquierda a derecha.

Si representamos los datos de las 10 autonomías escogidas se una línea claramente ascendente apoyando la conclusión mostrada en el titular.
 Pero, curiosamente si seleccionamos los datos de las otras 7 autonomías (algunas de tanto peso como Madrid o Cataluña) obtenemos una gráfica que parece indicar lo contrario.
Entonces, ¿a qué carta quedarnos? Ninguna de las dos parece concluyente. ¿No hay ninguna herramienta estadística que nos permita saber si algo es concluyente antes de hacer gráficas? Claro que sí, faltaría más. Se llama coeficiente de correlación lineal . Como se ve en la explicación de Wikipedia este número se mueve entre -1 y +1:
  • +1, entonces  la correlación en torno a una recta creciente.
  • -1, entonces la correlación en torno a una recta decreciente.
  • 0, no es posible llegar a ninguna conclusión. 
En este caso, los valores son:
  • Con todas las autonomías: 0,48
  • Sólo las seleccionadas por los autores del artículo: 0,84
  • Las demás autonomías: -0,86
Aquí hay una tabla en donde se clasifican lo seguro de una correlación a partir del valor este valor. Según esa tabla al conjunto de las autonomías le correspondería una correlación media, lo que parece que apoya, aunque sea parcialmente, la conclusión del artículo. Pero no olvidemos que en este escenario todas las autonomías entran con el mismo peso y quizás deberían tener más importancia las más pobladas (como Madrid o Cataluña) que están en el conjunto de las comunidades eliminadas del estudio.

Lo más importante: si queremos buscar la verdad no hay que colocar la conclusión delante de la investigación.

Hoja de cálculo con los datos, cálculos y gráficas: 

Fuentes de los datos usados: