전체 글 1230

상대위험도와 오즈비

질병이나 건강 관련 통계를 보면 “위험이 18% 증가한다”, “발병 가능성이 1.18배 높다”와 같은 표현을 자주 접하게 됩니다. 하지만 이러한 수치만 보면 실제 위험이 얼마나 증가한 것인지 직관적으로 판단하기 어렵습니다. 이번에는 매일 베이컨을 먹지 않는 사람과 먹는 사람의 대장암 발생률을 예시로 절대위험도, 상대위험도, 오즈비를 간단하게 살펴보겠습니다.1. 기대도수와 분모·분자를 기준으로 위험을 해석하는 방법같은 발생률이라도 어떤 값을 기준으로 보느냐에 따라 위험을 이해하는 방식이 달라질 수 있습니다.예를 들어 매일 베이컨을 먹지 않는 사람의 대장암 발생률이 6%, 매일 베이컨을 먹는 사람의 발생률이 7%라고 가정해보겠습니다. 1.1 기대도수로 보면 실제 인원 규모를 이해하기 쉽다 발생률을 100명을..

절대위험도와 상대위험도

건강이나 질병과 관련된 뉴스를 보면 다음과 같은 표현을 자주 볼 수 있습니다.“특정 음식을 먹으면 대장암 발생 위험이 증가한다.” 여기서 중요한 것은 위험이 얼마나 증가했는지 어떤 기준으로 표현했는가입니다. 같은 데이터를 사용하더라도 절대위험도와 상대위험도 중 무엇을 사용하느냐에 따라 위험이 크게 느껴질 수도, 작게 느껴질 수도 있습니다.1. 절대위험도란?절대위험도(Absolute Risk)는 특정 집단에서 실제로 사건이 발생할 확률을 의미합니다. 예를 들어 1,000명 중 10명에게 질병이 발생했다면 절대위험도는 다음과 같습니다. 10 / 1000 = 1% 즉, 실제로 질병이 발생할 가능성이 어느 정도인가를 보여주는 값입니다. 두 집단을 비교할 때는 절대위험도의 차이를 사용할 수도 있습니다. 절대위험..

그래프의 시작점이 해석을 바꾼다

데이터를 비교할 때는 단순히 그래프의 높이만 보는 것이 아니라 축이 어디에서 시작하는지를 함께 확인해야 합니다. 예를 들어 병원 간 생존율을 막대그래프로 비교한다고 가정해보겠습니다. 두 병원의 생존율이 97%와 98%라면 실제 차이는 1%p에 불과합니다. 하지만 그래프의 Y축을 95%부터 시작하면 막대 높이 차이가 크게 보이면서 실제보다 차이가 과장될 수 있습니다. 반대로 Y축을 0%부터 시작하면 두 병원의 차이는 훨씬 작게 보입니다.1. 같은 데이터도 축에 따라 다르게 보인다예를 들어 다음과 같은 데이터가 있다고 해보겠습니다.병원생존률A병원97%B병원98%Y축을 0%부터 시작→ 두 병원의 차이가 크지 않다는 점이 직관적으로 보입니다. Y축을 95%부터 시작→ 두 막대 사이의 차이가 매우 크게 보일 수 ..

같은 데이터도 다르게 보인다: 프레이밍과 숫자 해석의 중요성

데이터를 전달할 때는 단순히 숫자를 보여주는 것만으로는 충분하지 않습니다. 같은 사실이라도 어떻게 표현하느냐에 따라 받아들이는 의미가 크게 달라질 수 있기 때문입니다. 2011년 영국 런던의 지하철역에는 “런던에 사는 청소년의 99%가 심각한 폭력을 저지르지 않는다”는 형태의 광고가 등장한 적이 있습니다. 이 표현은 긍정적인 메시지를 강조한 사례입니다. 반대로 같은 내용을 다음과 같이 표현할 수도 있습니다.런던 청소년의 1%는 심각한 폭력을 저지른다.숫자는 같지만 전달되는 인상은 훨씬 강하게 부정적으로 바뀝니다. 이것이 바로 프레이밍 효과입니다. 1. 절대적인 숫자와 상대적인 비율을 함께 봐야 한다 비율만 보면 1%는 작아 보일 수 있습니다.하지만 런던 인구와 청소년 인구 규모를 함께 고려하면 실제 인원..

데이터 분석 프로젝트, 어디서부터 시작해야 할까? Why–What–How와 PPDAC로 정리하는 분석 절차

데이터 분석을 시작할 때 의외로 가장 어려운 부분은 통계 기법이나 모델링이 아닙니다. “무엇부터 시작해야 하는가?” 이 질문에서 막히는 경우가 많습니다. 데이터를 전달받자마자 시각화를 해보거나 상관분석을 수행하고, 경우에 따라서는 바로 머신러닝 모델을 만들어보기도 합니다. 하지만 분석 목적이 명확하지 않은 상태에서 분석부터 시작하면 결과는 만들어지더라도 왜 이 결과가 필요한지, 어떤 의사결정에 활용해야 하는지 설명하기 어려워질 수 있습니다. 데이터 분석에서는 단순히 분석을 수행하는 것보다 문제를 정의하고 분석의 방향을 설계하는 과정이 먼저 필요합니다. 이때 분석 프로젝트의 전체 방향을 잡는 데 활용할 수 있는 구조가 Why–What–How이고, 이후 실제 분석을 진행하고 결론을 도출하는 과정에서 활용할 ..

PPDAC 기반 통계 분석 프로세스: 문제 정의부터 결론 도출까지

데이터 분석을 진행하다 보면 평균, 상관분석, 회귀분석, t-test와 같은 통계 기법에 먼저 관심을 가지게 됩니다. 하지만 실제 분석에서는 어떤 통계 기법을 사용할 것인가보다 어떤 문제를 해결하려는지가 먼저 정의되어야 합니다. 이러한 통계적 문제 해결 과정을 체계적으로 정리한 프레임워크가 바로 PPDAC입니다. PPDAC는 다음 다섯 단계로 구성됩니다. Problem → Plan → Data → Analysis → Conclusion1. PPDAC란 무엇인가데이터를 활용해 문제를 정의하고, 분석 계획을 세우고, 데이터를 수집한 뒤 통계적으로 분석하여 최종 결론까지 도출하는 전체 분석 과정을 의미합니다. 단계의미핵심 질문Problem문제 정의무엇을 알고 싶은가?Plan분석 계획어떤 데이터를 어떻게 분석할..

[데이터 자료 수집] 실험과 관측연구

자료수집 방법은 크게 실험(Experiment)과 관측연구(Observational Study)로 구분할 수 있습니다. 두 방법의 가장 큰 차이는 연구자가 조건에 직접 개입하는지 여부입니다.1. 실험(Experiment)실험은 연구자가 실험 참가자를 여러 조건에 배치하고 그 결과를 비교하는 방법입니다. 연구자가 조건을 통제하기 때문에 설명변수가 반응변수에 어떤 영향을 미치는지, 즉 인과성(Causality)을 확인하는 데 적합합니다. 예시) 참가자를 무작위로 나눠 한 그룹은 8시간, 다른 그룹은 5시간 자도록 한 뒤 집중력 점수를 비교 → 연구자가 수면시간에 직접 개입 2. 관측연구(Observational Study)관측연구는 연구자가 개입하지 않고 이미 존재하는 데이터를 그대로 관찰하여 분석하는 방법..

통계 이론 2026.09.10

연구설계의 기본 구조

연구설계(Study Design)는 특정 조건이 결과에 실제로 영향을 주는지 확인하기 위해 실험군과 대조군을 비교하는 과정입니다. 파인만의 고무밴드 실험을 예로 들면, 확인하고 싶은 것은 물의 온도가 고무밴드의 탄력성에 영향을 주는지입니다. 구분실험 내용실험군(Treatment Group)고무밴드를 얼음물에 넣음 (연구자가 효과를 확인하고 싶은 처치·조건을 적용한 집단)대조군(Control Group)고무밴드를 미지근한 물에 넣음 (해당 처치를 적용하지 않거나, 기존 조건을 유지하는 비교 집단)설명변수(Explanatory Variable)물의 온도반응변수(Response Variable)고무밴드의 탄력성여기서 설명변수는 연구자가 변화시키거나 비교하는 조건이고, 반응변수는 그 조건에 따라 변화하는 결과입..

통계 이론 2026.09.09

엑셀 병합 셀 해제 후 빈 셀을 Ctrl + Enter로 한 번에 채우는 방법

엑셀에서 병합된 셀을 해제하면 기존 값은 병합 영역의 맨 위 셀에만 남고 나머지는 빈 셀이 됩니다.예를 들어 다음과 같은 데이터가 있다고 가정해보겠습니다. 부서직원명영업팀김민수 이서연 박지훈마케팅팀최유진 정하늘이런 빈 셀을 하나씩 복사하지 않고 Ctrl + Enter를 활용해 한 번에 채울 수 있습니다.1. 병합 셀 해제하기먼저 병합된 셀을 선택하고 병합을 해제합니다.병합을 해제하면 기존 값은 첫 번째 셀에만 남습니다. 영업팀빈 셀빈 셀2. 빈 셀만 선택하기값을 채울 범위를 선택한 뒤 다음 메뉴로 이동합니다.홈 → 찾기 및 선택 → 이동 옵션 (Ctrl + G) → 빈 셀그러면 선택한 범위에서 비어 있는 셀만 동시에 선택됩니다.3. 바로 위 셀 참조하기빈 셀이 모두 선택된 상태에서 다음과 같이 입력합니..

엑셀 VLOOKUP에서 고유값 열을 활용하는 방법

VLOOKUP을 사용할 때는 찾을 값이 조회 범위의 첫 번째 열에 있어야 합니다.또한 같은 값이 여러 번 존재하면 VLOOKUP은 위에서 처음 일치한 값만 반환합니다. 1. VLOOKUP은 첫 번째 열에서 값을 찾는다예를 들어 이름을 기준으로 평균 점수를 찾는다면, 조회 범위의 가장 왼쪽 열에 이름이 있어야 합니다. 기본 구조는 다음과 같습니다.=VLOOKUP(찾을값, 조회범위, 반환열번호, FALSE) 즉, VLOOKUP은 조회 범위의 왼쪽 열에서 값을 찾고 오른쪽 열의 값을 반환합니다. 2. 중복된 값이 있으면 첫 번째 값만 반환한다학생이 1차, 2차 시험을 모두 응시했다면 이름이 두 번 등장할 수 있습니다.예를 들어 박동주라는 이름이 두 행에 존재하면, 이름만으로 조회했을 때 VLOOKUP은 첫 번..