viernes, 18 de mayo de 2012

Tema 9. Estadística inferencial: muestreo y estimación.

  La inferencia estadística es el conjunto de procedimientos estadísticos que permiten pasar de la muestra a la población.
La población de estudio es el conjunto de pacientes sobre los que queremos estudiar algo.
La muestra es el conjunto de individuos concretos que participan en el estudio.
Siempre que utilizamos muestras hay que asumir un margen de error.
En el muestreo probabilístico o aleatorio se elige por un procedimiento de azar y el error se puede evaluar, se denomina error aleatorio. En los muestreos no probabilístico no es posible evaluar el error.

La medida que queremos obtener se llama parámetro, pero casi nunca la vamos a conocer porque tendríamos que estudiar a la población entera. Lo que podemos obtener es el estimador, que se realiza sobre la muestra.
Al proceso por el que a partir de un estimador, me aproximo al parámetro se denomina inferencia.

 Posteriormente vimos el concepto de error estándar.
 Mide el grado de variabilidad en los valores del estimador en las distintas muestras de un determinado tamaño que pudiésemos tomar de una población. Cuanto mayor sea el tamaño de la muestra, menor será el error estándar. Tenemos una fórmula para calcular el error estándar: para una media y para una proporción.

Intervalos de confianza. Son un medio de conocer el parámetro en una población midiendo el error que tiene que ver con el azar.
En clase realizamos varios ejemplos donde calculamos intervalos de confianza.

TIPOS DE MUESTREO
Probabilístico. Todos los sujetos de la población tienen una probabilidad distinta de cero en la selección de la muestra.
- Aleatorio simple. Cada unidad tiene la probabilidad equitativa de ser incluida en la muestra. No puede usarse cuando el universo es grande.
- Aleatorio sistemático. Cada unidad del universo tiene la misma probabilidad de ser seleccionada. Se elije un número aleatorio y a este se le va sumando el cociente entre el número de sujetos de la población y el de la muestra.
- Estratificado. Se caracteriza por la subdivisión de la población en subgrupos o estratos, debido a que las variables principales presentan cierta variabilidad.
- Conglomerado. En la selección de la muestra se toman los subgrupos o conjuntos de unidades conglomerados. El investigador no conoce la distribución de la variable. Es menos fiable que el aleatorio.

No probabilístico
No se sigue el proceso aleatorio. No puede considerarse que la muestra sea representativa de una población. El investigador decide, según sus objetivos, los elementos que integrarán la muestra: por conveniencia o intencional.
Hay dos subtipos:
Por cuotas. El investigador selecciona la muestra considerando algunos fenómenos o variables a estudiar.
Accidental. Consiste en utilizar para el estudio las personas disponibles en un momento dado, según lo que interesa estudiar.

Se puede calcular, mediante una fórmula, el tamaño de una muestra para estimar la media de una población.
También se puede calcular, mediante otra fórmula, el tamaño de una muestra cuando queremos estimar una proporción.
Realizamos varios ejercicios para practicar esto. Me ha parecido un tema interesante, las últimas fórmulas no recuerdo haberlas estudiado el año pasado en estadística y las he visto bastante útiles.

sábado, 12 de mayo de 2012

Tema 8.  Medidas de tendencia central, posición y dispersión.

  En este tema vimos, en primer lugar, dos grandes tipos de medidas estadísticas:
- Medidas de posición o tendencia central: dan idea de la magnitud de los datos.
- Medidas de dispersión o variabilidad: dan información acerca de la heterogeneidad de las observaciones.

Medidas de tendencia central
- Media. Es la suma de todos los valores de la variable entre el total de observaciones. Cuando los datos son agrupados, utilizamos como valor de referencia la marca de clase de cada intervalo.


- Mediana. Es el valor de la observación tal que un 50% de los datos es menor y otro 50% es mayor.
Si el valor de las observaciones es impar el valor de la mediana será la observación que ocupa la posición n+1/2.
Si el número de observaciones es par, el valor de la mediana es la media entre la observación n/2 y la observación n+1/2.
Tiene mejor comportamiento que la media cuando hay observaciones extremas.


- Moda. Es el valor que más se repite. Si los datos están agrupados se habla de clase modal y corresponde al intervalo en el que el cociente entre la frecuencia relativa y la amplitud es mayor.

Después de ver esto hicimos un ejercicio práctico para aplicar estos conceptos.

MEDIDAS DE POSICIÓN
Cuantiles. Se calculan para variables cuantitativas y solo tienen en cuenta la posición de los valores de la muestra. Los cuantiles más utilizados son percentiles, deciles y cuartiles, según dividan la muestra ordenada en 100, 10 o 4 partes, respectivamente.

Percentiles. Para buscar la posición de un percentil es una serie de datos agrupados, buscamos el intervalo en el que la frecuencia relativa acumulada (Hi) sea superior al valor del percentil. El valor del P50 corresponde al valor de la mediana.


Deciles. El valor de D5 corresponde al valor de la mediana y, por tanto, al del P50.


Cuartiles. El Q2 conincide con el valor de D5, con el valor de la mediana y del P50.
Por ejemplo el Q1 indica el valor que ocupa una posición en la serie numérica de forma que el 25% de las observaciones son menores y que el 75% son mayores.

MEDIDAS DE DISPERSIÓN
Rango o recorrido. Diferencia entre el mayor y el menor valor de la muestra.
Desviación media. Media aritmética de las distancias de cada observación con respecto a la media de la muestra.
Desviación típica. Cuantifica el error que cometemos si representamos una muestra únicamente por su media.
Varianza. Expresa la misma información que la desviación típica en valores cuadráticos.
Coeficiente de variación. Es una medida de dispersión relativa (adimensional). Nos sirve para comparar la heterogeneidad de dos series numéricas con independencia de las unidades de medida.

A continuación realizamos un ejercicio donde se pedía calcular las medidas estadísticas estudiadas anteriormente. Era un ejercicio fácil de entender aunque había que fijarse bien en los cálculos para no cometer errores. 

 Después vimos las distribuciones normales. Estas son las que con más frecuencia aparece en fenómenos reales y siguen unos principios básicos. Analizamos la campana de Gauss.
Posteriormente estudiamos las asimetrías y curtosis. 
El coeficiente de asimetría de una variable es el grado de asimetría de la distribución de sus datos en torno a su media. 
El coeficiente de apuntamiento o curtosis de una variable sirve para medir el grado de concentración de los valores que toma en torno a su media. Se elige como referencia una variable con distribución normal, de modo que para ella el coeficiente de curtosis es 0. 
Estudiamos los resultados que se podían obtener y el tipo de distribución en función de éstos.
Asimetrías
g1 = 0  Distribución simétrica
g1 > 0  Distribución asimétrica positiva
g1 <0  Distribución asimétrica negativa

Curtosis
g2 = 0  Distribución mesocúrtica
g2 > 0  Distribución leptocúrtica
g2 < 0  Distribución platicúrtica

  Me ha parecido un tema entretenido y muy práctico, esencial en estadística.  






jueves, 26 de abril de 2012

Tema 7. Introducción a la Bioestadística. Organización de datos.

La estadística es la ciencia que estudia la variabilidad. Parte del supuesto de que las características clínicas que se observan cambian de un paciente a otro.

Hay diferentes escalas de medida:
Escala nominal. Con esta medida solo se puede comprobar si dos características son iguales o diferentes. Se mide por ejemplo, la raza, el género, la profesión, etc. Las categorías deben ser exhaustivas (los puedo clasificar a todos) y excluyentes (no puedo clasificar a un sujeto en dos grupos).
Escala ordinal. Ante dos modalidades distintas determina cuál de ellas es mayor. Los números expresan relaciones de igualdad, desigualdad y orden. Ejemplo: grado de dolor, 1. nulo, 2. leve, 3. medio, 4. máximo.
Escala de intervalo. Presentan las características propias de las dos escalas anteriores. Las distancias o intervalos representan distancias equivalentes. No se pueden sacar razones o proporciones.
Escala de razón. Nivel más alto de medición. Establece relaciones de identidad, orden, existencia de intervalos equivalentes y cuántas veces una modalidad es superior a otra.

También estudiamos los tipos de variables:
Cualitativas. Se refiere a propiedades que no pueden ser medidas, solo se pueden clasificar.
                  Nominales.
                     - Dicotómicas: 2 categorías (Ej: sexo).
                     - Policotómicas: más de 2 categorías (Ej: estado civil).
                  Ordinales. Ej: nivel de dolor.

 Cuantitativas. Se pueden medir en término numéricos.
                        Discretas. Sólo pueden tomar un número finito de valores. Son números aislados.
                                          Ej: número de hijos.
                        Continuas. El número está dentro de un rango. Ej: talla, peso.


                                           
Representación de datos.
Tablas de frecuencia. Son la imagen de los datos que muestran frecuencia en columnas y las categorías de las variables en filas.














  Para variables discretas.



Para variables continuas tenemos que construir intervalos. El número de intervalos se calcula haciendo la raíz cuadrada del número de datos. El recorrido se calcula restando el dato menor al mayor. Para obtener la amplitud del intervalo dividimos el recorrido por el número de intervalos.

La representación es sencilla pero entretenida cuando hay muchos datos y hay que ser cauteloso y tener paciencia a la hora de contar para no equivocarse.

En una tabla tienen que aparecer: intervalos, marcas de clase, frecuencia absoluta, frecuencia absoluta acumulada, frecuencia relativa y frecuencia relativa acumulada.








Gráfico de tronco y hojas. Forma híbrida entre tabla e histograma.
Gráfico para datos bidimensionales. Estudia el comportamiento de una variable en función de otra, haciendo una evolución histórica.
 


Gráfico de sectores. Para variables cualitatitavas dicotómicas.

 


Gráfico para datos multidimensionales: diagrama de estrellas.

Me ha resultado un tema sencillo, en el que hay que tener claro algunos conceptos y ponerlos en práctica para la elaboración de tablas y gráficos.