layout: true class: animated, fadeIn --- class: inverse, left, middle # _Analizando bivariadamente en R 馃攷X鈫旓笍Y_ Mart铆n Venegas M谩rquez *** [Doctorado en Psicolog铆a UDP - Seminario Metodol贸gico Disciplinario: Metodolog铆as Cuantitativas - Oto帽o 2025]() <br> #### Junio, 2025 ---  ---  ---  ---  --- class: inverse, left, middle # Contenidos de la sesi贸n -- **0. Recordando...** -- **1. An谩lisis bivariado descriptivo** -- **2. An谩lisis bivariado inferencial** -- **3. Manos a la obra** --- class: middle, center, inverse # _0. Recordando..._ --- # Frecuencias --- class: middle, center # Medidas de tendencia central --- | Tipo de medida | Funci贸n en R | Descripci贸n breve | |-------------------------|--------------------------|------------------------------------------------------------------------------| | Tendencia central | `mean(x)` | Calcula la media (promedio) de `x`. | | Tendencia central | `mean(x, trim = 0.1)` | Media recortada: excluye un porcentaje de valores extremos. | | Tendencia central | `median(x)` | Devuelve la mediana de `x` (valor central). | | Tendencia central | `statip::mfv(x)` | Calcula la moda (valor o valores m谩s frecuentes). | | Dispersi贸n | `var(x)` | Calcula la varianza de `x`. | | Dispersi贸n | `sd(x)` | Desviaci贸n est谩ndar: ra铆z cuadrada de la varianza. | | Dispersi贸n | `range(x)` | Devuelve el valor m铆nimo y m谩ximo de `x`. | | Dispersi贸n | `IQR(x)` | Rango intercuart铆lico: diferencia entre el tercer y primer cuartil (Q3 - Q1). | | Posici贸n / Cuantiles | `quantile(x)` | Entrega los cuantiles de `x` (por defecto: 0%, 25%, 50%, 75%, 100%). | --- # Tipos de gr谩ficos con `sjPlot` | Tipo de gr谩fico | Uso principal | Argumentos clave en `plot_frq()` | |-----------------------|---------------------------------------------------------|---------------------------------------------| | Gr谩fico de barras | Visualizar frecuencias absolutas o relativas de factores| `type = "bar"` (valor por defecto) | | Histograma | Distribuci贸n de variables num茅ricas | `type = "hist"` | | Gr谩fico de densidad | Distribuci贸n suavizada de variables num茅ricas | `type = "dens"` | | Boxplot (cajas) | Visualizar la mediana, cuartiles y valores at铆picos | `type = "box"` | --- # 驴Qu茅 es el an谩lisis bivariado? 馃 -- .large[Es el estudio simult谩neo de **dos variables** para comprender su relaci贸n] -- .large[Permite:] -- .large[(1) Detectar patrones 馃搱] -- .large[(2) Formular o contrastar hip贸tesis 馃挕] -- .large[(3) Preparar el camino para modelos m谩s complejos 馃殌] --- # Importancia en la investigaci贸n social 馃攷 -- .large[Las relaciones entre variables son el coraz贸n de las preguntas en la investigaci贸n social:] - 驴Afecta el nivel educativo la participaci贸n pol铆tica? - 驴Hay desigualdad de ingresos seg煤n g茅nero? - 驴Existe una relaci贸n entre edad y actitudes hacia pol铆ticas p煤blicas? -- .large[El an谩lisis bivariado nos ayuda a:] - Identificar **asociaciones relevantes**. - Evaluar **desigualdades** y **brechas**. - Formular **modelos explicativos**. --- # Tipos de relaciones a explorar -- .large[馃搹 ** Categ贸rica + Continua:** Comparaci贸n de estad铆sticos por cada categor铆a] -- .large[馃П **Categ贸rica + Categ贸rica:** Distribuci贸n conjunta de frecuencias] -- .large[**馃搱 Continua + Continua:** Covarianzas y correlaciones] --- class: middle, center, inverse # _1. An谩lisis bivariado descriptivo_ --- # Retomemos los datos de ejemplo... ```r datos <- data.frame( persona = c("Juan", "Matias", "Ana", "Leonor", "Sebastian"), edad = c(24, 35, 45, 65, 12), sexo = c("Hombre", "Hombre", "Mujer", "Mujer", "Hombre"), ingresos = c(1000000, 800000, 1300000, 1500000, 0), region = c("Metropolitana", "Metropolitana", "Valparaiso", "Valparaiso", "Antofagasta") ) ``` --- # 1. Categ贸rica + Continua 馃搹 -- Implica analizar los estad铆sticos de inter茅s (media, mediana, desviaci贸n est谩ndar, etc) de una variable cuantitativa en base a las categor铆as de una variable categ贸rica -- Por ejemplo: -- ```r datos %>% group_by(sexo) %>% summarise(media = mean(edad)) ``` ``` ## # A tibble: 2 脳 2 ## sexo media ## <chr> <dbl> ## 1 Hombre 23.7 ## 2 Mujer 55 ``` --- # 1. Categ贸rica + Continua 馃搹 -- Con `dplyr` podemos crear una columna por cada estad铆stico de inter茅s: -- ```r datos %>% group_by(sexo) %>% summarise( n = n(), min = min(edad), max = max(edad), media = mean(edad), mediana = median(edad), DE = sd(edad) ) ``` ``` ## # A tibble: 2 脳 7 ## sexo n min max media mediana DE ## <chr> <int> <dbl> <dbl> <dbl> <dbl> <dbl> ## 1 Hombre 3 12 35 23.7 24 11.5 ## 2 Mujer 2 45 65 55 55 14.1 ``` --- # 1. Categ贸rica + Continua 馃搹 -- Una visualizaci贸n com煤n: -- Boxplots por grupo... -- ```r # Generemos datos aleatorios para la visualizaci贸n set.seed(1) datos2 <- data.frame( edad = sample(18:98, 10000, replace = T), sexo = sample(c("Hombre", "Mujer"), 10000, replace = T) ) # Generar boxplot sjPlot::plot_grpfrq(datos2$edad, datos2$sexo, type = "boxplot") ``` --- # 1. Categ贸rica + Continua 馃搹 <!-- --> --- # 2. Categ贸rica + Categ贸rica 馃П -- Se analiza la distribuci贸n conjunta de dos variables categ贸ricas. Esto implica ver las frecuencias (porcentuales y absolutas) por cada combinaci贸n de categor铆as. -- **La presentaci贸n m谩s com煤n:** tablas de contingencia/tablas de doble entrada -- .center[] --- # 2. Categ贸rica + Categ贸rica 馃П ## Un amigo... `janitor::tabyl()` ```r # Cargar paquete library(janitor) # Crear datos aleatorios set.seed(1) datos3 <- data.frame( educ = sample(c("Sin educaci贸n formal", "Primaria completa", "Secundaria incompleta", "Terciaria y postitulo"), 10000, replace = T), sexo = sample(c("Hombre", "Mujer"), 10000, replace = T) ) # Generar tabla datos3 %>% tabyl(sexo, educ) %>% %>% # Funci贸n que hace la pega! adorn_percentages("row") %>% # Calcular porcentajes por fila adorn_pct_formatting(digits = 2) %>% # Formatear porcentajes adorn_ns() # Agregar n's ``` --- # 2. Categ贸rica + Categ贸rica 馃П ## Un amigo... `janitor::tabyl()` -- Veamos los porcentajes por **fila**... -- ``` ## sexo Primaria completa Secundaria incompleta Sin educaci贸n formal ## Hombre 25.06% (1,283) 24.18% (1,238) 25.78% (1,320) ## Mujer 24.86% (1,213) 24.73% (1,207) 24.98% (1,219) ## Terciaria y postitulo ## 24.98% (1,279) ## 25.43% (1,241) ``` -- Y los porcentajes por **columnas** -- ``` ## sexo Primaria completa Secundaria incompleta Sin educaci贸n formal ## Hombre 51.40% (1,283) 50.63% (1,238) 51.99% (1,320) ## Mujer 48.60% (1,213) 49.37% (1,207) 48.01% (1,219) ## Terciaria y postitulo ## 50.75% (1,279) ## 49.25% (1,241) ``` --- ## Otro amigo... `sjPlot::sjt.xtab()` ```r sjPlot::sjt.xtab(datos3$sexo, datos3$educ) # Solo n ``` <table style="border-collapse:collapse; border:none;"> <tr> <th style="border-top:double; text-align:center; font-style:italic; font-weight:normal; border-bottom:1px solid;" rowspan="2">sexo</th> <th style="border-top:double; text-align:center; font-style:italic; font-weight:normal;" colspan="4">educ</th> <th style="border-top:double; text-align:center; font-style:italic; font-weight:normal; font-weight:bolder; font-style:italic; border-bottom:1px solid; " rowspan="2">Total</th> </tr> <tr> <td style="border-bottom:1px solid; text-align:center; padding:0.2cm;">Primaria completa</td> <td style="border-bottom:1px solid; text-align:center; padding:0.2cm;">Secundaria<br>incompleta</td> <td style="border-bottom:1px solid; text-align:center; padding:0.2cm;">Sin educaci贸n formal</td> <td style="border-bottom:1px solid; text-align:center; padding:0.2cm;">Terciaria y<br>postitulo</td> </tr> <tr> <td style="padding:0.2cm; text-align:left; vertical-align:middle;">Hombre</td> <td style="padding:0.2cm; text-align:center; "><span style="color:black;">1283</span></td> <td style="padding:0.2cm; text-align:center; "><span style="color:black;">1238</span></td> <td style="padding:0.2cm; text-align:center; "><span style="color:black;">1320</span></td> <td style="padding:0.2cm; text-align:center; "><span style="color:black;">1279</span></td> <td style="padding:0.2cm; text-align:center; "><span style="color:black;">5120</span></td> </tr> <tr> <td style="padding:0.2cm; text-align:left; vertical-align:middle;">Mujer</td> <td style="padding:0.2cm; text-align:center; "><span style="color:black;">1213</span></td> <td style="padding:0.2cm; text-align:center; "><span style="color:black;">1207</span></td> <td style="padding:0.2cm; text-align:center; "><span style="color:black;">1219</span></td> <td style="padding:0.2cm; text-align:center; "><span style="color:black;">1241</span></td> <td style="padding:0.2cm; text-align:center; "><span style="color:black;">4880</span></td> </tr> <tr> <td style="padding:0.2cm; border-bottom:double; font-weight:bolder; font-style:italic; text-align:left; vertical-align:middle;">Total</td> <td style="padding:0.2cm; text-align:center; border-bottom:double;"><span style="color:black;">2496</span></td> <td style="padding:0.2cm; text-align:center; border-bottom:double;"><span style="color:black;">2445</span></td> <td style="padding:0.2cm; text-align:center; border-bottom:double;"><span style="color:black;">2539</span></td> <td style="padding:0.2cm; text-align:center; border-bottom:double;"><span style="color:black;">2520</span></td> <td style="padding:0.2cm; text-align:center; border-bottom:double;"><span style="color:black;">10000</span></td> </tr> <td style="text-align:right; font-size:0.9em; font-style:italic; padding:0.2cm;" colspan="6">χ<sup>2</sup>=1.188 · df=3 · Cramer's V=0.011 · p=0.756</td> </tr> </table> --- ## Otro amigo... `sjPlot::sjt.xtab()` ```r sjPlot::sjt.xtab(datos3$sexo, datos3$educ, show.cell.prc = TRUE) # Porcentaje por filas ``` <table style="border-collapse:collapse; border:none;"> <tr> <th style="border-top:double; text-align:center; font-style:italic; font-weight:normal; border-bottom:1px solid;" rowspan="2">sexo</th> <th style="border-top:double; text-align:center; font-style:italic; font-weight:normal;" colspan="4">educ</th> <th style="border-top:double; text-align:center; font-style:italic; font-weight:normal; font-weight:bolder; font-style:italic; border-bottom:1px solid; " rowspan="2">Total</th> </tr> <tr> <td style="border-bottom:1px solid; text-align:center; padding:0.2cm;">Primaria completa</td> <td style="border-bottom:1px solid; text-align:center; padding:0.2cm;">Secundaria<br>incompleta</td> <td style="border-bottom:1px solid; text-align:center; padding:0.2cm;">Sin educaci贸n formal</td> <td style="border-bottom:1px solid; text-align:center; padding:0.2cm;">Terciaria y<br>postitulo</td> </tr> <tr> <td style="padding:0.2cm; text-align:left; vertical-align:middle;">Hombre</td> <td style="padding:0.2cm; text-align:center; "><span style="color:black;">1283</span><br><span style="color:#993333;">12.8 %</span></td> <td style="padding:0.2cm; text-align:center; "><span style="color:black;">1238</span><br><span style="color:#993333;">12.4 %</span></td> <td style="padding:0.2cm; text-align:center; "><span style="color:black;">1320</span><br><span style="color:#993333;">13.2 %</span></td> <td style="padding:0.2cm; text-align:center; "><span style="color:black;">1279</span><br><span style="color:#993333;">12.8 %</span></td> <td style="padding:0.2cm; text-align:center; "><span style="color:black;">5120</span><br><span style="color:#993333;">51.2 %</span></td> </tr> <tr> <td style="padding:0.2cm; text-align:left; vertical-align:middle;">Mujer</td> <td style="padding:0.2cm; text-align:center; "><span style="color:black;">1213</span><br><span style="color:#993333;">12.1 %</span></td> <td style="padding:0.2cm; text-align:center; "><span style="color:black;">1207</span><br><span style="color:#993333;">12.1 %</span></td> <td style="padding:0.2cm; text-align:center; "><span style="color:black;">1219</span><br><span style="color:#993333;">12.2 %</span></td> <td style="padding:0.2cm; text-align:center; "><span style="color:black;">1241</span><br><span style="color:#993333;">12.4 %</span></td> <td style="padding:0.2cm; text-align:center; "><span style="color:black;">4880</span><br><span style="color:#993333;">48.8 %</span></td> </tr> <tr> <td style="padding:0.2cm; border-bottom:double; font-weight:bolder; font-style:italic; text-align:left; vertical-align:middle;">Total</td> <td style="padding:0.2cm; text-align:center; border-bottom:double;"><span style="color:black;">2496</span><br><span style="color:#993333;">25 %</span></td> <td style="padding:0.2cm; text-align:center; border-bottom:double;"><span style="color:black;">2445</span><br><span style="color:#993333;">24.4 %</span></td> <td style="padding:0.2cm; text-align:center; border-bottom:double;"><span style="color:black;">2539</span><br><span style="color:#993333;">25.4 %</span></td> <td style="padding:0.2cm; text-align:center; border-bottom:double;"><span style="color:black;">2520</span><br><span style="color:#993333;">25.2 %</span></td> <td style="padding:0.2cm; text-align:center; border-bottom:double;"><span style="color:black;">10000</span><br><span style="color:#993333;">100 %</span></td> </tr> <td style="text-align:right; font-size:0.9em; font-style:italic; padding:0.2cm;" colspan="6">χ<sup>2</sup>=1.188 · df=3 · Cramer's V=0.011 · p=0.756</td> </tr> </table> --- ## Otro amigo... `sjPlot::sjt.xtab()` ```r sjPlot::sjt.xtab(datos3$sexo, datos3$educ, show.col.prc = TRUE) # Porcentaje por filas ``` <table style="border-collapse:collapse; border:none;"> <tr> <th style="border-top:double; text-align:center; font-style:italic; font-weight:normal; border-bottom:1px solid;" rowspan="2">sexo</th> <th style="border-top:double; text-align:center; font-style:italic; font-weight:normal;" colspan="4">educ</th> <th style="border-top:double; text-align:center; font-style:italic; font-weight:normal; font-weight:bolder; font-style:italic; border-bottom:1px solid; " rowspan="2">Total</th> </tr> <tr> <td style="border-bottom:1px solid; text-align:center; padding:0.2cm;">Primaria completa</td> <td style="border-bottom:1px solid; text-align:center; padding:0.2cm;">Secundaria<br>incompleta</td> <td style="border-bottom:1px solid; text-align:center; padding:0.2cm;">Sin educaci贸n formal</td> <td style="border-bottom:1px solid; text-align:center; padding:0.2cm;">Terciaria y<br>postitulo</td> </tr> <tr> <td style="padding:0.2cm; text-align:left; vertical-align:middle;">Hombre</td> <td style="padding:0.2cm; text-align:center; "><span style="color:black;">1283</span><br><span style="color:#339933;">51.4 %</span></td> <td style="padding:0.2cm; text-align:center; "><span style="color:black;">1238</span><br><span style="color:#339933;">50.6 %</span></td> <td style="padding:0.2cm; text-align:center; "><span style="color:black;">1320</span><br><span style="color:#339933;">52 %</span></td> <td style="padding:0.2cm; text-align:center; "><span style="color:black;">1279</span><br><span style="color:#339933;">50.8 %</span></td> <td style="padding:0.2cm; text-align:center; "><span style="color:black;">5120</span><br><span style="color:#339933;">51.2 %</span></td> </tr> <tr> <td style="padding:0.2cm; text-align:left; vertical-align:middle;">Mujer</td> <td style="padding:0.2cm; text-align:center; "><span style="color:black;">1213</span><br><span style="color:#339933;">48.6 %</span></td> <td style="padding:0.2cm; text-align:center; "><span style="color:black;">1207</span><br><span style="color:#339933;">49.4 %</span></td> <td style="padding:0.2cm; text-align:center; "><span style="color:black;">1219</span><br><span style="color:#339933;">48 %</span></td> <td style="padding:0.2cm; text-align:center; "><span style="color:black;">1241</span><br><span style="color:#339933;">49.2 %</span></td> <td style="padding:0.2cm; text-align:center; "><span style="color:black;">4880</span><br><span style="color:#339933;">48.8 %</span></td> </tr> <tr> <td style="padding:0.2cm; border-bottom:double; font-weight:bolder; font-style:italic; text-align:left; vertical-align:middle;">Total</td> <td style="padding:0.2cm; text-align:center; border-bottom:double;"><span style="color:black;">2496</span><br><span style="color:#339933;">100 %</span></td> <td style="padding:0.2cm; text-align:center; border-bottom:double;"><span style="color:black;">2445</span><br><span style="color:#339933;">100 %</span></td> <td style="padding:0.2cm; text-align:center; border-bottom:double;"><span style="color:black;">2539</span><br><span style="color:#339933;">100 %</span></td> <td style="padding:0.2cm; text-align:center; border-bottom:double;"><span style="color:black;">2520</span><br><span style="color:#339933;">100 %</span></td> <td style="padding:0.2cm; text-align:center; border-bottom:double;"><span style="color:black;">10000</span><br><span style="color:#339933;">100 %</span></td> </tr> <td style="text-align:right; font-size:0.9em; font-style:italic; padding:0.2cm;" colspan="6">χ<sup>2</sup>=1.188 · df=3 · Cramer's V=0.011 · p=0.756</td> </tr> </table> --- ## Otro amigo... `sjPlot::sjt.xtab()` ```r sjPlot::sjt.xtab(datos3$sexo, datos3$educ, show.cell.prc = TRUE, show.col.prc = TRUE) # Ambos porcentjaes ``` <table style="border-collapse:collapse; border:none;"> <tr> <th style="border-top:double; text-align:center; font-style:italic; font-weight:normal; border-bottom:1px solid;" rowspan="2">sexo</th> <th style="border-top:double; text-align:center; font-style:italic; font-weight:normal;" colspan="4">educ</th> <th style="border-top:double; text-align:center; font-style:italic; font-weight:normal; font-weight:bolder; font-style:italic; border-bottom:1px solid; " rowspan="2">Total</th> </tr> <tr> <td style="border-bottom:1px solid; text-align:center; padding:0.2cm;">Primaria completa</td> <td style="border-bottom:1px solid; text-align:center; padding:0.2cm;">Secundaria<br>incompleta</td> <td style="border-bottom:1px solid; text-align:center; padding:0.2cm;">Sin educaci贸n formal</td> <td style="border-bottom:1px solid; text-align:center; padding:0.2cm;">Terciaria y<br>postitulo</td> </tr> <tr> <td style="padding:0.2cm; text-align:left; vertical-align:middle;">Hombre</td> <td style="padding:0.2cm; text-align:center; "><span style="color:black;">1283</span><br><span style="color:#339933;">51.4 %</span><br><span style="color:#993333;">12.8 %</span></td> <td style="padding:0.2cm; text-align:center; "><span style="color:black;">1238</span><br><span style="color:#339933;">50.6 %</span><br><span style="color:#993333;">12.4 %</span></td> <td style="padding:0.2cm; text-align:center; "><span style="color:black;">1320</span><br><span style="color:#339933;">52 %</span><br><span style="color:#993333;">13.2 %</span></td> <td style="padding:0.2cm; text-align:center; "><span style="color:black;">1279</span><br><span style="color:#339933;">50.8 %</span><br><span style="color:#993333;">12.8 %</span></td> <td style="padding:0.2cm; text-align:center; "><span style="color:black;">5120</span><br><span style="color:#339933;">51.2 %</span><br><span style="color:#993333;">51.2 %</span></td> </tr> <tr> <td style="padding:0.2cm; text-align:left; vertical-align:middle;">Mujer</td> <td style="padding:0.2cm; text-align:center; "><span style="color:black;">1213</span><br><span style="color:#339933;">48.6 %</span><br><span style="color:#993333;">12.1 %</span></td> <td style="padding:0.2cm; text-align:center; "><span style="color:black;">1207</span><br><span style="color:#339933;">49.4 %</span><br><span style="color:#993333;">12.1 %</span></td> <td style="padding:0.2cm; text-align:center; "><span style="color:black;">1219</span><br><span style="color:#339933;">48 %</span><br><span style="color:#993333;">12.2 %</span></td> <td style="padding:0.2cm; text-align:center; "><span style="color:black;">1241</span><br><span style="color:#339933;">49.2 %</span><br><span style="color:#993333;">12.4 %</span></td> <td style="padding:0.2cm; text-align:center; "><span style="color:black;">4880</span><br><span style="color:#339933;">48.8 %</span><br><span style="color:#993333;">48.8 %</span></td> </tr> <tr> <td style="padding:0.2cm; border-bottom:double; font-weight:bolder; font-style:italic; text-align:left; vertical-align:middle;">Total</td> <td style="padding:0.2cm; text-align:center; border-bottom:double;"><span style="color:black;">2496</span><br><span style="color:#339933;">100 %</span><br><span style="color:#993333;">25 %</span></td> <td style="padding:0.2cm; text-align:center; border-bottom:double;"><span style="color:black;">2445</span><br><span style="color:#339933;">100 %</span><br><span style="color:#993333;">24.4 %</span></td> <td style="padding:0.2cm; text-align:center; border-bottom:double;"><span style="color:black;">2539</span><br><span style="color:#339933;">100 %</span><br><span style="color:#993333;">25.4 %</span></td> <td style="padding:0.2cm; text-align:center; border-bottom:double;"><span style="color:black;">2520</span><br><span style="color:#339933;">100 %</span><br><span style="color:#993333;">25.2 %</span></td> <td style="padding:0.2cm; text-align:center; border-bottom:double;"><span style="color:black;">10000</span><br><span style="color:#339933;">100 %</span><br><span style="color:#993333;">100 %</span></td> </tr> <td style="text-align:right; font-size:0.9em; font-style:italic; padding:0.2cm;" colspan="6">χ<sup>2</sup>=1.188 · df=3 · Cramer's V=0.011 · p=0.756</td> </tr> </table> --- # 3. 馃搱 Continua + Continua: ## 馃敆 Correlaci贸n de Pearson -- .large[Es una medida que cuantifica la **fuerza y direcci贸n** de la relaci贸n lineal entre dos variables num茅ricas] -- .large[Tambi茅n se conoce como **coeficiente de correlaci贸n de Pearson** o simplemente **r**.] --- ## 馃敆 Correlaci贸n de Pearson ### 馃М Definici贸n matem谩tica -- La covarianza dividida por el producto de las desviaciones est谩ndar de cada variable -- $$ r = \frac{\sum (X_i - \bar{X})(Y_i - \bar{Y})} {\sqrt{\sum (X_i - \bar{X})^2} \cdot \sqrt{\sum (Y_i - \bar{Y})^2}} $$ -- Tambi茅n puede expresarse como: -- $$ r = \frac{\text{Cov}(X, Y)}{\sigma_X \cdot \sigma_Y} $$ --- ## 馃敆 Correlaci贸n de Pearson ### 馃搱 Interpretaci贸n -- - **r = 1**: correlaci贸n perfectamente positiva - **r = -1**: correlaci贸n perfectamente negativa - **r = 0**: no hay relaci贸n lineal --- ## 馃敆 Correlaci贸n de Pearson ### 馃捇 En R -- ```r cor(x, y) ``` -- Veamos un ejemplo -- ```r cor(datos$edad, datos$ingresos) ``` ``` ## [1] 0.8814577 ``` --- ## 馃敆 Correlaci贸n de Pearson ### 驴C贸mo se interpreta? 馃 -- Seg煤n Cohen... -- - tama帽o de efecto **peque帽o**: alrededor de **0.10** - tama帽o de efecto **mediano**: alrededor de **0.30** - tama帽o de efecto **grande**: alrededor de **0.50 y m谩s** --- # 3. 馃搱 Continua + Continua: ## Gr谩ficos de dispersi贸n (_scatter plot_) -- Creemos unos datos de ejemplo... ```r set.seed(123) datos4 <- data.frame( edad = sample(18:99, 1000, replace = TRUE) ) # Relaci贸n moderada: ingresos dependen parcialmente de la edad + ruido datos4$ingresos <- datos4$edad * 30000 + rnorm(1000, mean = 0, sd = 300000) # Asegurarse de que los ingresos sean positivos datos4$ingresos <- ifelse(datos4$ingresos < 0, 0, datos4$ingresos) ``` --- ## Gr谩ficos de dispersi贸n (_scatter plot_) .pull-left[ <!-- --> ] .pull-right[.large[**驴Qu茅 se puede interpretar de ac谩? 馃**]] -- .pull-right[ ```r cor(datos4$edad, datos4$ingresos) ``` ``` ## [1] 0.9240157 ``` ] --- class: middle, center, inverse # _2. An谩lisis bivariado inferencial_ --- # 1. Categ贸rica + Continua 馃搹 ## Prueba t 馃帀 -- .large[La prueba m谩s com煤n para este tipo de combinaci贸n de variables] -- .large[Permite conocer si las **diferencias entre las medias de dos grupos distintos** son estad铆sticamente significativas] -- .large[Por ejemplo:] -- `\(H_0:\)` No existen diferencias entre los ingresos medios de hombres y mujeres `\(H_1:\)` Existen diferencias entre los ingresos medios de hombres y mujeres --- # 1. Categ贸rica + Continua 馃搹 ## Prueba t 馃帀 -- .large[Tambi茅n, si los antecedentes o la teor铆a lo permite, se pueden contrastar hip贸tesis **direccionales**. Es decir...] -- ### Mayor a... `\(H_0:\)` Los ingresos medios de los hombres son menores o iguales a los de las mujeres `\(H_1:\)` Los ingresos medios de los hombres son mayores a los de las mujeress --- # 1. Categ贸rica + Continua 馃搹 ## Prueba t 馃帀 .large[Tambi茅n, si los antecedentes o la teor铆a lo permite, se pueden contrastar hip贸tesis **direccionales**. Es decir...] -- ### Menor a... `\(H_0:\)` Los ingresos medios de los hombres son mayores o iguales a los de las mujeres `\(H_1:\)` Los ingresos medios de los hombres son menores a los de las mujeres --- ## Prueba t 馃帀 ### En R 馃捇 -- Creemos otros datos de ejemplo... ```r set.seed(1) datos6 <- data.frame( sexo = rep(c("Hombre", "Mujer"), each = 50), ingresos = c(rnorm(50, mean = 1800000, sd = 200000), # Hombres con media m谩s alta rnorm(50, mean = 1500000, sd = 200000))) # Mujeres con media m谩s baja ``` --- ## Prueba t 馃帀 ### En R 馃捇 -- ```r t.test(ingresos ~ sexo, data = datos6) # No direccional ``` ``` ## ## Welch Two Sample t-test ## ## data: ingresos by sexo ## t = 8.2146, df = 95.793, p-value = 0.000000000001009 ## alternative hypothesis: true difference in means between group Hombre and group Mujer is not equal to 0 ## 95 percent confidence interval: ## 224946.2 368302.6 ## sample estimates: ## mean in group Hombre mean in group Mujer ## 1820090 1523465 ``` -- .large[驴Qu茅 podemos decir de este resultado? 馃] --- ## Prueba t 馃帀 ### En R 馃捇 -- ```r t.test(ingresos ~ sexo, data = datos6, alternative = "greater") # Direccional: mayor a ``` ``` ## ## Welch Two Sample t-test ## ## data: ingresos by sexo ## t = 8.2146, df = 95.793, p-value = 0.0000000000005046 ## alternative hypothesis: true difference in means between group Hombre and group Mujer is greater than 0 ## 95 percent confidence interval: ## 236650 Inf ## sample estimates: ## mean in group Hombre mean in group Mujer ## 1820090 1523465 ``` -- .large[驴Qu茅 podemos decir de estos resultados? 馃] --- ## Prueba t 馃帀 ### En R 馃捇 -- ```r t.test(ingresos ~ sexo, data = datos6, alternative = "less") # Direccional: menor a ``` ``` ## ## Welch Two Sample t-test ## ## data: ingresos by sexo ## t = 8.2146, df = 95.793, p-value = 1 ## alternative hypothesis: true difference in means between group Hombre and group Mujer is less than 0 ## 95 percent confidence interval: ## -Inf 356598.7 ## sample estimates: ## mean in group Hombre mean in group Mujer ## 1820090 1523465 ``` -- .large[驴Qu茅 podemos decir de estos resultados? 馃] --- # 2. Categ贸rica + Categ贸rica 馃П ## Test de Chi-cuadrado -- .large[Es una **prueba estad铆stica** usada para analizar si existe una relaci贸n significativa entre dos variables categ贸ricas] -- .large[Compara las frecuencias observadas con las esperadas bajo la **hip贸tesis de independencia**] -- `\(H_0\)`: La variable X e Y son independientes entre si `\(H_1\)`: La variable X e Y no son independientes entre si --- ## Test de Chi-cuadrado ### C谩lcular 馃М -- Se basa en la f贸rmula: -- $$ \chi^2 = \sum \frac{(O - E)^2}{E} $$ -- Donde: -- - \( O \): frecuencia observada - \( E \): frecuencia esperada bajo la hip贸tesis de independencia --- ## Test de Chi-cuadrado ### Ejemplo 馃槑 -- Pensemos en un set de datos que contiene dos variables: sexo y preferencia por bebida caliente. -- .pull-left[ .center[Tabla 1. Frecuencias observadas] | | Caf茅 | T茅 | Total | |---------|------|----|-------| | Hombre | 30 | 10 | 40 | | Mujer | 20 | 40 | 60 | | Total | 50 | 50 | 100 | ] -- .pull-right[ Queremos saber si hay asociaci贸n entre g茅nero y preferencia de bebida. 馃 Es decir... `\(H_0\)`: El sexo y la preferencia por bebida caliente son independientes entre si `\(H_1\)`: El sexo y la preferencia por bebida caliente **no** son independientes entre si ] --- ## Test de Chi-cuadrado: paso a paso 馃М (1) ** Calcular frecuencias esperadas**: .pull-left[ .center[Tabla 1. Frecuencias observadas] | | Caf茅 | T茅 | Total | |---------|------|----|-------| | Hombre | 30 | 10 | **40** | | Mujer | 20 | 40 | 60 | | Total | **50** | 50 | 100 | ] .pull-right[ $$ E_{ij} = \frac{(fila_i) \cdot (columna_j)}{\text{Total}} $$ Ejemplo para Hombre-Caf茅: $$ E_{Hombre-Caf茅} = \frac{40 \cdot 50}{100} = 20 $$ ] --- ## Test de Chi-cuadrado: paso a paso 馃М (1) **Calcular frecuencias esperadas**: .pull-left[ .center[Tabla 1. Frecuencias observadas] | | Caf茅 | T茅 | Total | |---------|------|----|-------| | Hombre | 30 | 10 | 40 | | Mujer | 20 | 40 | 60 | | Total | 50 | 50 | 100 | ] .pull-right[ .center[Tabla 2. Frecuencias esperadas] | | Caf茅 | T茅 | Total | |---------|------|----|-------| | Hombre | `\(\frac{40 \cdot 50}{100} = 20\)` | `\(\frac{40 \cdot 50}{100} = 20\)` | 40 | | Mujer | `\(\frac{60 \cdot 50}{100} = 30\)` | `\(\frac{60 \cdot 50}{100} = 30\)` | 60 | | Total | 50 | 50 | 100 | ] --- ## Test de Chi-cuadrado: paso a paso 馃М (2) **Calcular Chi-cuadrado parcial (por celda)** .pull-left[ .center[Tabla 1. Frecuencias observadas] | | Caf茅 | T茅 | Total | |---------|------|----|-------| | Hombre | 30 | 10 | 40 | | Mujer | 20 | 40 | 60 | | Total | 50 | 50 | 100 | ] .pull-right[ .center[Tabla 2. Frecuencias esperadas] | | Caf茅 | T茅 | Total | |---------|------|----|-------| | Hombre | `\(\frac{40 \cdot 50}{100} = 20\)` | `\(\frac{40 \cdot 50}{100} = 20\)` | 40 | | Mujer | `\(\frac{60 \cdot 50}{100} = 30\)` | `\(\frac{60 \cdot 50}{100} = 30\)` | 60 | | Total | 50 | 50 | 100 | ] `\(\chi^2_{ij} = \frac{(O - E)^2}{E}\)` `\(\chi^2_{Hombre-Caf茅} = \frac{(30 - 20)^2}{20} = \frac{100}{20} = 5\)` Se repite para cada celda, luego se suman todos los valores. --- ## Test de Chi-cuadrado: paso a paso 馃М (3) **Chi-cuadrado total**: .pull-left[ .center[Tabla 1. Frecuencias observadas] | | Caf茅 | T茅 | Total | |---------|------|----|-------| | Hombre | 30 | 10 | 40 | | Mujer | 20 | 40 | 60 | | Total | 50 | 50 | 100 | .left[ Recordemos la formula: `\(\chi^2 = \sum \frac{(O - E)^2}{E}\)` ] ] .pull-right[ .center[Tabla 2. Frecuencias esperadas] | | Caf茅 | T茅 | Total | |---------|------|----|-------| | Hombre | `\(\frac{40 \cdot 50}{100} = 20\)` | `\(\frac{40 \cdot 50}{100} = 20\)` | 40 | | Mujer | `\(\frac{60 \cdot 50}{100} = 30\)` | `\(\frac{60 \cdot 50}{100} = 30\)` | 60 | | Total | 50 | 50 | 100 | .left[ Apliquemosla: `\(\chi^2 = \frac{(30 - 20)^2}{20} + \frac{(10 - 20)^2}{20} + \frac{(20 - 30)^2}{30} + \frac{(40 - 30)^2}{30}\)` `\(\chi^2 = 5 + 5 + 3.33 + 3.33 = 16.66\)` ] ] --- ## Test de Chi-cuadrado ### C谩lculo en R 馃捇 ```r # Crear un dataframe simulado datos5 <- data.frame( genero = c(rep("Hombre", 40), rep("Mujer", 60)), bebida = c(rep("Caf茅", 30), rep("T茅", 10), rep("Caf茅", 20), rep("T茅", 40)) ) chisq.test(datos5$genero, datos5$bebida, correct = FALSE) ``` ``` ## ## Pearson's Chi-squared test ## ## data: datos5$genero and datos5$bebida ## X-squared = 16.667, df = 1, p-value = 0.00004456 ``` 驴Qu茅 podemos concluir? 馃 --- # 3. 馃搱 Continua + Continua: ## 馃敆 Correlaci贸n de Pearson -- .large[Anteriormente, vimos la funci贸nm para obtener la **magnitud** del coeficiente de correlaci贸n (`cor()`), pero...] -- .large[驴C贸mo conocemos su informaci贸n relativa a la inferencia estad铆stica? 馃] -- Con: `cor.test()` --- # 3. 馃搱 Continua + Continua: ## 馃敆 Correlaci贸n de Pearson -- ```r cor.test(datos4$edad, datos4$ingresos) ``` ``` ## ## Pearson's product-moment correlation ## ## data: datos4$edad and datos4$ingresos ## t = 76.345, df = 998, p-value < 0.00000000000000022 ## alternative hypothesis: true correlation is not equal to 0 ## 95 percent confidence interval: ## 0.9144019 0.9325877 ## sample estimates: ## cor ## 0.9240157 ``` -- .large[驴Qu茅 podemos decir de este resultado? 馃] -- .large[驴Qu茅 hip贸tesis pusimos a prueba? 馃攷] --- class: middle, center, inverse # _隆Muchas gracias!_