Calculadora de P-Valor

p-value
Siguiente

Ingresa una estadística de prueba, z, t o chi-cuadrado, junto con los grados de libertad cuando sea relevante, y la calculadora devuelve el p-valor para hipótesis de una o dos colas. Es un elemento básico en tareas de estadística y pruebas A/B: una vez que tienes la estadística de prueba de tus datos, esto la convierte en la probabilidad de observar algo al menos tan extremo bajo la hipótesis nula.

Cómo se calculan los p-valores

  1. 1

    Elige la distribución

    z para medias y proporciones de muestras grandes, t para medias de muestras pequeñas con desviación estándar conocida, chi-cuadrado para bondad de ajuste y tablas de contingencia.

  2. 2

    Ingresa la estadística

    Tu valor observado de z, t o chi-cuadrado de los datos.

  3. 3

    Elige colas

    Dos colas para "diferente en cualquier dirección", una cola para hipótesis direccionales de "mayor" o "menor que".

  4. 4

    Lee el p-valor

    El área en la(s) cola(s) de la distribución más allá de tu estadística.

Tabla de referencia (dos colas)

Estadística p-valor Interpretación
z = 1.64 0.10 Marginal
z = 1.96 0.05 Umbral clásico
z = 2.58 0.01 Fuerte
z = 3.29 0.001 Muy fuerte
t(20) = 2.09 0.05 ~1.96 equivalente para df = 20
t(5) = 2.57 0.05 Muestras pequeñas elevan el crítico

Qué significa un p-valor

Un p-valor es la probabilidad, asumiendo que la hipótesis nula es verdadera, de ver una estadística de prueba al menos tan extrema como la que observaste. Un p pequeño significa que los datos serían poco probables bajo la nula, así que la nula está equivocada, o tuviste mala suerte.

Qué no significa un p-valor

  • No es la probabilidad de que la hipótesis nula sea verdadera.
  • No es la probabilidad de que replicarás el hallazgo.
  • No es el tamaño del efecto. Un efecto pequeño e insignificante puede dar p < 0.001 con una muestra lo suficientemente grande.
  • No es un umbral que separa lo “real” de lo “no real”, 0.05 es una convención, no una ley.

Elegir una cola vs dos colas

Usa una cola solo cuando tengas una hipótesis direccional genuina especificada antes de ver los datos (tu medicamento solo puede ayudar, no perjudicar). De lo contrario, usa dos colas. Cambiar a una cola después de los hechos para obtener menos de 0.05 es p-hacking y socava la inferencia.

Errores comunes

  • Comparaciones múltiples. Realiza 20 pruebas, espera que una alcance p < 0.05 por casualidad. Usa Bonferroni o Benjamini–Hochberg.
  • N grande, efecto pequeño. Una muestra de millones marcará diferencias del 0.1% como significativas. Siempre reporta tamaños de efecto junto a los p-valores.
  • Dichotomización. “Significativo vs no significativo” pierde información. p = 0.048 y p = 0.052 son efectivamente la misma fuerza de evidencia.
  • Lectura incorrecta de chi-cuadrado. p es una función tanto de la estadística como de los grados de libertad; un chi-cuadrado de 10 es significativo en df=2 (p=0.0067) pero no en df=20 (p=0.97).

Preguntas frecuentes

Por convención 0.05, pero los umbrales deben ajustarse al costo de estar equivocado. Los ensayos médicos a menudo usan 0.01 o más estrictos. Algunos campos argumentan por 0.005 como un valor predeterminado.

Las muestras más grandes reducen el error estándar, por lo que los efectos triviales se vuelven “significativos”. Siempre reporta el tamaño del efecto (d de Cohen, razón de probabilidades, diferencia bruta) junto al p-valor.

Dos colas por defecto. Una cola solo está justificada cuando tienes una hipótesis direccional genuina fijada antes de la recolección de datos.

z asume que conoces la desviación estándar de la población (raro); t se usa cuando la estimas a partir de la muestra. Para muestras grandes convergen.

Significa que los datos serían inusuales bajo la nula. La replicación, el tamaño del efecto y el mecanismo importan más que un solo valor p.

Herramientas relacionadas

Herramienta disponible en otros idiomas