전체 글 1239

통계와 통계학의 차이

2.통계와 통계학은 비슷하게 들리지만 의미는 다릅니다.1. 통계(Statistics)통계는 데이터를 정리하고 요약하여 나타낸 수치나 정보를 의미합니다.예를 들어 평균 연봉, 실업률, 평균 키, 매출 증가율처럼 데이터를 통해 현재 상태나 특징을 보여주는 값이 통계에 해당합니다.통계 = 데이터를 요약해서 보여주는 결과 2. 통계학(Statistics)통계학은 데이터를 어떻게 수집하고, 분석하고, 해석할 것인지 다루는 학문이자 방법론입니다.특히 표본 데이터를 이용해 패턴과 관계를 파악하고, 확률을 통해 불확실성을 평가하여 모집단의 특성을 추론합니다.통계학 = 데이터를 이용해 신뢰할 수 있는 결론을 만드는 방법3. 차이를 간단히 정리하면구분의미통계데이터를 요약한 수치와 정보통계학데이터를 수집·분석·해석하는 방법..

통계 이론 2026.09.28

통계학의 기본 흐름: 데이터에서 패턴을 찾고 모집단을 추론하는 과정

통계학을 단순히 평균이나 표준편차를 계산하는 학문으로 생각하면 전체 흐름을 이해하기 어렵습니다. 통계학은 데이터를 수집하고 특징을 파악한 뒤, 그 안에서 발견한 패턴이 얼마나 믿을 만한지를 평가하고 최종적으로 더 큰 집단에 대한 결론과 의사결정으로 연결하는 과정으로 볼 수 있습니다. 전체 흐름은 다음과 같습니다.데이터 수집 → 데이터 요약·탐색 → 패턴과 관계 파악 → 불확실성 평가 → 모집단 추론 → 의사결정이번 글에서는 A 변수와 B 변수 사이의 상관관계를 확인하는 상황을 예로 들어 이 흐름을 살펴보겠습니다.1. 데이터 수집통계 분석의 출발점은 데이터입니다. 예를 들어 어떤 회사에서 **직원의 공부 시간(A)**과 업무 성과(B) 사이에 관계가 있는지 알고 싶다고 가정해보겠습니다.모든 직원을 조사하..

통계 이론 2026.09.28

2026 Big Data 활용 대회 프로젝트 회고

2026 빅데이터활용대회 | DX Challenge 2026 빅데이터활용대회 | DX Challenge 부산 빅데이터 혁신센터가 제공하는 오픈랩 데이터 및 부산광역시 Big-데이터웨이브 및 공공데이터를 기반으로, 부산 지역의 사회적 현안과 지역문제를 발견하고 이를 해결할 창의적인 솔루션www.dxchallenge.co.kr 공모전 제출 자료 ↓ 이번 2026 Big Data 활용 대회 공모전 프로젝트를 돌아보면서 가장 먼저 정리하고 싶었던 것은 단순히 “탈락했다”는 결과가 아니라, 내가 어떤 방식으로 분석을 구성했고, 어디에서 멈췄는가였습니다. 그래서 이번 회고는 글만 길게 쓰는 대신, 먼저 목차 레이아웃 이미지를 기준으로 생각을 정리해보려고 합니다.이번 이미지는 단순한 목차가 아니라, 이번 프로젝..

표에서 ‘합계·전체·계·소계’는 어떻게 구분할까?

표를 작성할 때 비슷해 보이는 합계, 전체, 계, 소계는 다음과 같이 구분할 수 있다.표현의미일반적인 위치합계금액·건수처럼 값을 직접 더한 결과마지막 행전체비율·평균 등을 전체 원자료 기준으로 다시 계산한 결과첫 번째 행계합계 또는 전체를 포괄하는 행정·통계표 표현요약표는 첫 행, 집계표는 마지막 행소계세부 그룹별 중간 합산 결과각 그룹의 마지막 행총계여러 소계를 모두 합친 최종 결과표의 마지막 행어떻게 선택하면 될까?금액이나 건수만 합산했다면 합계건수와 전체 비율·평균이 함께 있다면 전체공공기관의 행정·통계표라면 계여러 하위 항목을 중간 집계했다면 소계여러 소계를 최종 합산했다면 총계예를 들어 구·군별 방문 횟수와 전체 방문 비율을 함께 보여주는 요약표라면, 단순한 합산 이상의 의미가 있으므로 전체가 ..

데이터 시각화에서 Scale이 중요한 이유: 같은 데이터도 다르게 보이는 원리

데이터를 시각화할 때 그래프의 형태만큼 중요한 것이 Scale(축의 범위)입니다.같은 데이터를 사용하더라도 Y축의 범위를 어떻게 설정하느냐에 따라 변화가 매우 크게 보일 수도 있고, 거의 변화가 없는 것처럼 보일 수도 있습니다.1. Scale이란 무엇인가?Scale은 그래프에서 데이터를 표현하는 축의 범위와 간격을 의미합니다.예를 들어 연평균 기온이 56°F에서 58°F로 상승했다고 가정해보겠습니다.Y축을 0~100°F로 설정하면 2°F의 변화는 매우 작게 보입니다. 반대로 Y축을 56~59°F 정도로 좁히면 동일한 변화가 상당히 큰 상승처럼 보입니다. 즉,데이터는 동일하지만 Scale에 따라 사용자가 받아들이는 변화의 크기는 달라질 수 있습니다. 2. 같은 기후 데이터가 전혀 다르게 보이는 이유아래 이..

플로우맵으로 읽는 나폴레옹의 1812년 러시아 원정

플로우맵(Flow Map)은 지도 위에서 사람이나 물자의 이동 경로와 규모를 함께 표현하는 시각화 방법입니다. 단순히 어디에서 어디로 이동했는지만 보여주는 것이 아니라, 선의 방향과 두께를 활용해 이동의 흐름과 규모까지 함께 전달할 수 있습니다. 대표적인 사례가 프랑스의 토목공학자 샤를 조제프 미나르(Charles Joseph Minard)가 제작한 나폴레옹의 1812년 러시아 원정 시각화입니다 1. 선의 두께로 병력 감소를 표현하다미나르의 시각화에서 가장 중요한 요소는 선의 두께입니다. 나폴레옹 군대가 러시아를 향해 진격할 때는 선이 매우 두껍게 시작하지만, 이동이 계속될수록 선이 점차 가늘어집니다. 이는 이동 과정에서 병력이 계속 감소하고 있음을 의미합니다. 또한 진격과 후퇴 경로를 서로 다른 색상..

로즈 다이어그램

로즈 다이어그램(Rose Diagram)은 데이터를 원형으로 배치하고, 각 방향으로 뻗은 막대의 길이를 통해 값의 크기를 표현하는 시각화 방법입니다. 일반적인 막대그래프가 데이터를 가로 또는 세로 방향으로 비교한다면, 로즈 다이어그램은 데이터를 원형으로 배치하기 때문에 시간, 방향처럼 반복되는 주기를 가진 데이터를 표현할 때 효과적입니다. 1. 시간대별 활동량을 표현한다면위 시각화에서는 하루 24시간을 원형으로 배치하고 시간대별 활동량을 막대의 길이로 표현했습니다. 막대가 길수록 해당 시간대의 활동량이 많다는 의미입니다. 이를 통해 새벽에는 활동량이 낮고, 오전부터 점차 증가하며 점심과 저녁 시간대에 활동량이 높아지는 패턴을 한눈에 확인할 수 있습니다. 특히 24시간 이후 다시 0시로 돌아가는 것처럼 ..

분석 목차를 WHAT–Problem 정리: PPDAC 기반 질문 확장 구조

데이터 분석 프로젝트의 목차를 보면 흔히 이용현황 분석, 혼잡시간대 분석, 이용자 분석처럼 분석 항목 중심으로 구성되어 있습니다. 하지만 이 목차를 그대로 따라가다 보면 “왜 이 분석을 하는지”, 그리고 “앞선 분석 결과가 다음 분석과 어떻게 연결되는지”가 보이지 않을 수 있습니다. 이때 기존 분석 목차를 WHY → WHAT → Problem → Conclusion → 후속 질문의 구조로 바꾸어 보면 전체 프로젝트의 흐름을 조금 더 명확하게 정리할 수 있습니다. 이번 글에서는 주차장 분석 사례를 바탕으로 기존 분석 목차를 WHAT–Problem 구조로 재구성하고, 각 질문에 PPDAC를 적용해 다음 분석으로 확장하는 방법을 정리합니다.1. 분석 목차를 먼저 질문으로 바꿔보기이번 분석의 가장 큰 목적은 다..

분석 질문은 어떻게 이어지는가? WHAT에서 후속 Problem으로 확장하는 PPDAC 구조

데이터 분석 프로젝트에서는 하나의 질문을 정하고 분석했다고 해서 모든 문제가 해결되는 것은 아닙니다. 앞선 글에서는 Why–What–How로 분석 프로젝트의 방향을 설계하고, PPDAC를 통해 실제 분석을 수행하는 과정을 정리했습니다. 데이터 분석 프로젝트, 어디서부터 시작해야 할까? Why–What–How와 PPDAC로 정리하는 분석 절차 데이터 분석 프로젝트, 어디서부터 시작해야 할까? Why–What–How와 PPDAC로 정리하는 분석 절차데이터 분석을 시작할 때 의외로 가장 어려운 부분은 통계 기법이나 모델링이 아닙니다. “무엇부터 시작해야 하는가?” 이 질문에서 막히는 경우가 많습니다. 데이터를 전달받자마자 시각화를wnsgud4553.tistory.com Why는 분석 목적, What은 확인해야..

상대위험도와 오즈비

질병이나 건강 관련 통계를 보면 “위험이 18% 증가한다”, “발병 가능성이 1.18배 높다”와 같은 표현을 자주 접하게 됩니다. 하지만 이러한 수치만 보면 실제 위험이 얼마나 증가한 것인지 직관적으로 판단하기 어렵습니다. 이번에는 매일 베이컨을 먹지 않는 사람과 먹는 사람의 대장암 발생률을 예시로 절대위험도, 상대위험도, 오즈비를 간단하게 살펴보겠습니다.1. 기대도수와 분모·분자를 기준으로 위험을 해석하는 방법같은 발생률이라도 어떤 값을 기준으로 보느냐에 따라 위험을 이해하는 방식이 달라질 수 있습니다.예를 들어 매일 베이컨을 먹지 않는 사람의 대장암 발생률이 6%, 매일 베이컨을 먹는 사람의 발생률이 7%라고 가정해보겠습니다. 1.1 기대도수로 보면 실제 인원 규모를 이해하기 쉽다 발생률을 100명을..