전체 글 1244

표준정규분포와 표준오차를 활용한 신뢰구간 계산 원리

1. 신뢰구간에서 표준정규분포를 사용하는 이유모집단 평균을 추정할 때는 표본평균과 표준오차를 활용합니다. 이때 표준정규분포는 신뢰구간을 얼마나 넓게 설정해야 하는지 결정하는 기준이 됩니다. 표준정규분포는 평균이 0, 표준편차가 1인 정규분포로, 중앙 95%에 해당하는 범위는 다음과 같습니다. 표준정규분포에서 -1.96부터 +1.96까지의 면적은 약 95%입니다.따라서 95% 신뢰구간에서는 1.96을 임계값으로 사용합니다. 2. 왜 1.96에 표준오차를 곱할까?핵심은 표준정규분포의 세계에서 실제 데이터의 세계로 변환하기 위해서입니다.1.96: 표준화된 분포에서 중심으로부터의 거리표준오차(SE): 표본평균이 변동하는 정도1.96 × SE: 실제 데이터 단위로 환산한 오차한계예를 들어 표본평균이 60점이고 표..

통계 이론 10:39:03

표본 하나로 모집단 평균을 추정하는 원리

모집단 전체를 조사하지 않더라도 하나의 표본으로 모집단 평균을 추정할 수 있습니다. 핵심은 표본에서 계산한 표준오차를 이용해 표집분포의 변동성을 추정하고, 이를 바탕으로 모평균의 신뢰구간을 계산하는 것입니다. 1. 표본 하나로 모집단 평균을 추정할 수 있을까?모집단에서 표본을 여러 번 추출하면 매번 표본평균이 달라집니다. 예를 들어 표본을 5번 추출했다고 가정하겠습니다.표본표본 평균표본 158표본 262표본 359표본 461표본 560이처럼 반복 추출한 표본평균들이 이루는 확률분포를 표집분포(Sampling Distribution)라고 합니다. 문제는 현실에서 표본을 수백 번 반복 추출하기 어렵다는 점입니다. 그렇다면 표본을 한 번만 추출해도 표집분포의 변동성을 추정할 수 있을까요? 2. 표준오차를 이용..

통계 이론 2026.10.10

표집 분포(Sampling Distribution)

1. 표집분포란?표집분포(Sampling Distribution)란 모집단에서 표본을 반복 추출했을 때, 각 표본에서 계산한 통계량들이 이루는 확률분포입니다. 예를 들어 모집단에서 100명씩 표본을 반복 추출한다고 가정하겠습니다. 2. 표집분포의 그래프 표집분포에서 중요한 것은 표본의 크기(n)에 따라 표본평균의 퍼짐 정도가 달라진다는 것입니다. 아래 그래프는 모평균 60, 모표준편차 10인 정규모집단에서 추출한 표본평균의 이론적 분포입니다. 3. 표집분포의 평균과 표준오차 모집단 평균이 mu, 표준편차가 sigma이고, 표본 크기가 n일 때 독립적인 무작위 표본추출을 가정하면 다음과 같습니다. 3.1 표집 분포의 평균 표본평균의 기대값은 모집단 평균과 같습니다. 3.2 표집분포의 표준오차 표준오차..

통계 이론 2026.10.10

[확률분포] 표준편차가 작을수록 모집단 평균을 정확하게 추정할 수 있는 이유

1. 표준편차와 모집단 추정의 관계통계적 추론은 표본에서 얻은 통계량을 이용하여 모집단의 특성을 추정하는 과정입니다. 이때 표준편차가 작을수록 데이터가 평균 주변에 집중되므로, 동일한 표본 크기에서 모집단 평균을 더 정밀하게 추정할 수 있습니다. 반대로 표준편차가 크면 데이터가 넓게 퍼져 있어 표본평균의 변동성도 커집니다.2. 표준편차에 따른 정규분포 비교아래 그래프는 평균은 같지만 표준편차가 다른 두 정규분포입니다.표준편차가 작을수록 분포가 평균 주변에 집중되고, 클수록 넓게 퍼집니다.여기서 중요한 것은 표준편차가 작으면 표본을 다시 추출하더라도 표본평균이 크게 달라질 가능성이 줄어든다는 점입니다.3. 왜 모집단 평균을 더 정밀하게 추정할까요?모집단 평균을 추정할 때 사용하는 대표적인 지표는 표준오차(..

통계 이론 2026.10.09

[확률분포] 지수분포

1. 지수분포란?지수분포(Exponential Distribution)는 다음 사건이 발생하기까지 걸리는 대기시간의 확률을 나타내는 연속확률분포입니다. 예를 들어, 고객센터에 평균 3분마다 전화가 걸려온다고 가정해 보겠습니다. 우리가 궁금한 것은 다음과 같습니다.평균적으로 3분마다 전화가 오는데, 다음 전화가 1분 안에 걸려올 확률은 얼마일까?지수분포는 이러한 질문에 활용할 수 있습니다. 단, 사건이 서로 독립적이며 일정한 평균 발생률을 갖는 포아송 과정을 가정합니다.구분포아송분포지수분포분석 대상사건 발생 횟수다음 사건까지 대기시간핵심 질문5분 동안 몇 번 발생할까?1분 안에 발생할까?데이터 유형이산형연속형 2. 지수분포 계산 예시 문제: K 서비스센터에는 5분 동안 평균 1.5회의 전화가 걸려옵니다. ..

통계 이론 2026.10.09

[확률분포] 이산확률분포표의 이해

확률분포는 확률변수 X가 가질 수 있는 값과 각 값에 대응하는 확률을 나타낸 것입니다. 특히 확률분포는 단순히 현재 관측된 표본의 분포를 보여주는 것이 아니라, 모집단에서 해당 확률변수가 어떤 형태로 나타나는지를 확률 구조로 표현한 것이라고 이해하면 좋습니다. 즉,표본의 관측 결과 → 도수분포모집단의 확률 구조 → 확률분포확률분포가 성립하려면 각 확률은 0과 1 사이에 있어야 하고, 모든 확률의 합은 1이 되어야 합니다. 1. 이산확률변수와 확률분포표 이산확률변수는 셀 수 있는 값을 가지는 확률변수입니다. 동전을 두 번 던졌을 때 앞면의 개수를 X라고 하면 다음과 같습니다.사건 XP(X)뒷면, 뒷면01/4앞면 1개12/4앞면, 앞면21/4따라서 확률분포는처럼 표현할 수 있습니다. 이처럼 확률변수의 값과 ..

통계 이론 2026.10.06

자료형에 따라 달라지는 분석표와 시각화 선택 기준

데이터 분석에서 시각화를 시작할 때 가장 먼저 고민해야 하는 것은 어떤 그래프를 그릴 것인가가 아니라, 분석하려는 변수가 어떤 자료형인가입니다. 같은 그래프라도 자료형에 맞지 않게 사용하면 데이터를 제대로 해석하기 어렵습니다. 따라서 데이터 분석에서는 보통 다음과 같은 흐름으로 접근할 수 있습니다. 자료형 확인 → 변수 개수 확인 → 분석표 선택 → 그래프 선택 → 결과 해석1. 수치형 변수 하나를 분석하는 경우키, 몸무게, 매출액, 진료시간처럼 숫자로 측정되는 데이터는 수치형 변수입니다. 수치형 변수 하나를 분석할 때는 데이터가 어느 정도에 집중되어 있는지, 얼마나 퍼져 있는지, 이상치는 존재하는지를 확인하는 것이 중요합니다. 대표적인 분석표는 기술통계표입니다.통계량확인 내용평균데이터의 대표적인 크기중..

통계 이론 2026.10.05

[가설검정] 경험적 법칙과 표준오차로 이해하는 가설검정

정규분포에서는 데이터가 평균을 중심으로 일정한 범위 안에 모이는 경향이 있습니다. 이를 경험적 법칙(Empirical Rule)이라고 합니다.평균 ± 1표준편차: 약 68%평균 ± 2표준편차: 약 95%평균 ± 3표준편차: 약 99.7%즉, 평균에서 2표준편차보다 멀리 떨어진 값은 비교적 드물고, 3표준편차를 벗어나는 값은 매우 드물다고 볼 수 있습니다. 1. 표준오차는 무엇을 의미할까?표준오차(Standard Error)는 표본평균이 얼마나 흔들릴 수 있는지를 나타내는 값입니다.여기서 s는 표본표준편차, n은 표본크기입니다. 예를 들어 아이스크림 100개를 한 번 뽑았을 때 표준편차가 5g이라면, 입니다.이 값은 아이스크림 100개씩 반복해서 표본을 뽑는다고 가정했을 때, 각 표본평균들이 모집단 평균 ..

통계 이론 2026.10.04

표준편차와 표준화: 데이터의 위치를 해석하는 방법

데이터 분석에서는 평균만으로 전체 분포를 이해하기 어렵습니다.같은 평균을 가진 데이터라도 값들이 평균 주변에 모여 있을 수도 있고, 넓게 퍼져 있을 수도 있기 때문입니다. 이때 사용하는 대표적인 지표가 표준편차이며, 이를 기준으로 개별 값의 상대적인 위치를 표현한 것이 표준화(Z-score)입니다.1. 표준편차와 데이터 분포표준편차(Standard Deviation)는 데이터가 평균을 중심으로 얼마나 퍼져 있는지 나타내는 지표입니다. 표준편차가 작으면 값들이 평균 근처에 모여 있고, 표준편차가 크면 값들이 넓게 퍼져 있다고 볼 수 있습니다. 정규분포를 따르는 데이터에서는 표준편차를 기준으로 데이터가 어느 범위에 포함되는지 대략적으로 파악할 수 있습니다.이를 경험적 법칙(Empirical Rule)이라고 ..

통계 이론 2026.10.04

AI로 분석하면서 놓친 것 데이터프레임을 직접 마주하는 과정

최근 공공데이터를 활용해 수산가공식품의 생산 동향을 분석했다. AI의 도움을 받아 필요한 수치를 빠르게 집계하고 표와 그래프를 만들었지만, 분석을 진행할수록 원인을 설명하는 데 한계가 느껴졌다.문제는 데이터를 직접 확인하지 않은 것이었다.1. 결과부터 찾기 시작했다AI를 활용한 뒤부터는 먼저 질문을 만들고 필요한 결과를 요청하는 방식으로 분석했다.연도별 생산량은 얼마인가?어떤 식품유형의 생산량이 증가했는가?어떤 제품을 후속 분석 대상으로 선정할 것인가?이 방식은 빠르고 효율적이었다. 하지만 I0300 데이터를 사실상 연도, 식품유형, 생산량만 있는 자료처럼 사용하게 만들었다. 2. 데이터프레임을 다시 확인했다원자료의 HEAD(10)을 확인하자 그동안 충분히 활용하지 못한 변수들이 보였다.인허가번호업소명소..