초보 환영! Python 기본 문법, 리스트 & 딕셔너리 정복으로 데이터 분석 시작!
파이썬 기초 다지기: 데이터 분석을 위한 첫걸음!
안녕! 오늘은 데이터 분석을 위한 파이썬 기초를 같이 배워볼 거야. 앞으로 우리가 데이터 분석을 하려면 파이썬이라는 언어를 먼저 알아야 하거든. 마치 게임을 하려면 조작법을 먼저 익혀야 하는 것처럼 말이지!
왜 파이썬을 배울까?
데이터 분석을 할 때 '넘파이'나 '판다스' 같은 멋진 도구들
...안녕! 오늘은 데이터 분석을 위한 파이썬 기초를 같이 배워볼 거야. 앞으로 우리가 데이터 분석을 하려면 파이썬이라는 언어를 먼저 알아야 하거든. 마치 게임을 하려면 조작법을 먼저 익혀야 하는 것처럼 말이지!
데이터 분석을 할 때 '넘파이'나 '판다스' 같은 멋진 도구들
...안녕! 오늘은 파이썬으로 데이터를 다루는 데 꼭 필요한 판다스라는 도구를 배울 거야. 특히, 데이터 프레임이라는 걸 집중적으로 다뤄볼 건데, 이게 뭐냐면 엑셀처럼 표처럼 생긴 데이터를 쉽게 다룰 수 있게 도와주는 거야.
판다스는 마치 요리할 때 칼, 도마처
...이번 시간에는 데이터 프레임에서 내가 원하는 열(column)이랑 행(row)을 골라내는 방법을 배울 거야. 이름으로 골라낼 수도 있고, 번호(인덱스)로 골라낼 수도 있어. 그리고 특정 조건을 만족하는 데이터만 쏙쏙 뽑아내는 방법도 알아볼 거야.
먼저 '판다스'
...이번 시간에는 데이터를 추가하고, 삭제하고, 수정하고, 정렬하는 방법을 알아볼 거야. 마치 내 방을 깨끗하게 정리하는 것처럼, 데이터를 깔끔하게 다듬는 거지!
이번 시간에는 데이터를 그룹으로 묶어서 요약하는 방법을 배울 거야. 마치 반 친구들끼리 모여서 평균 점수를 내거나, 학년별로 모여서 좋아하는 과목을 알아보는 것처럼 말이지!
groupby()는 데이터를 특정 기준에 따라 묶어주는 마법 같은 기능이야
이번 시간까지만 집중하면 판다스로 데이터 프레임을 다루는 건 거의 끝이야! 오늘은 여러 데이터 프레임을 합치는 컨캣(concat)이랑 머지(merge)에 대해 알아볼 건데, 이건 마치 SQL의 '조인'이랑 비슷한 개념이라고 생각하면 돼.
이번 시간에는 시험에 나올 만한 내용들을 중심으로 EDA에 대해 알아볼 거야. EDA는 탐색적 데이터 분석의 줄임말로, 데이터를 본격적으로 분석하기 전에 데이터를 이해하기 위해 꼭 해야 하는 첫 번째 단계야.
데이터를 분석하기 전에 EDA를 하는 이유는 마치 책을 읽기 전
...이번 시간에는 파이썬으로 데이터 분석을 할 때 꼭 필요한 도구들을 준비하고, 우리가 사용하는 코딩 환경을 제대로 설정하는 방법을 알아볼 거야. 이미 앞에서 실습하면서 몇 번 해봤겠지만, 이번 기회에 다시 한번 확실하게 정리해보자!
read_csv(): CSV 파일 불러오기데이터를 불러왔으면 이제 그 데이터가 어떻게 생겼는지 알아보는 게 중요해. 마치 새로운 친구를 만났을 때 이름, 나이, 취미 같은 걸 물어보는 것처럼 말이야. 이걸 '데이터 구성 확인'이라고 하는데, 이걸 잘 해둬야 나중에 데이터를 가지고 뭘 할지 결정하기 쉬워.
이번에는 데이터 프레임 전체 말고, 딱! 변수 하나만 집중해서 파헤쳐 볼 거야. 이걸 일변량 분석이라고 불러. 변수가 숫자(수치형)인지, 아니면 몇 가지 정해진 말(범주형)인지에 따라 분석 방법이 달라.
숫자로 된 변수는 통계량이나 그래프
...하나의 변수만 보는 건 이제 끝! 이제부터는 두 개 이상의 변수가 서로 어떻게 연결되어 있는지 알아보는 이변량 분석을 할 거야. 마치 친구들끼리 누가 누구랑 친한지 알아보는 것처럼 말이지!
크게 세 가지 경우로 나눠서 볼 수 있어.
데이터를 표로만 보면 뭐가 뭔지 알기 어렵잖아? 그래서 그림으로 보여주는 게 바로 데이터 시각화야. 이걸 잘하면 데이터 속에 숨겨진 규칙이나 특별한 점들을 쉽게 찾을 수 있지.
파이썬에서 그래프를 그릴 때 가장 많이 쓰는 두 가지 도구가 있어. 바로 **Matplotl
...이번 시간엔 앞에서 배운 데이터 시각화 방법을 더 다양한 그래프로 연습해볼 거야. 실제 시험에서 당황하지 않도록 말이지!
이번 파트에서는 데이터를 깨끗하게 만들어서 컴퓨터가 잘 이해할 수 있도록 하는 방법을 배울 거야. 특히 숫자로 된 데이터에서 빠진 값, 즉 '결측치'를 어떻게 다룰지 알아볼 거야.
저번 시간에 데이터에 빠진 값, 즉 결측치에 대해 알아봤지? 이번 시간에는 데이터에서 다른 값들과 너무 동떨어진, 이상치라는 녀석들을 어떻게 다룰지 배울 거야.
이상치는 말 그대로 다른 값들과 비교했을 때 엄청나게 크거나 작은 값을 말해. 왜 생기냐면,
*
...이번 시간에는 데이터를 보기 좋게, 이해하기 쉽게 '구간'으로 나누는 방법을 배울 거야. 이걸 '데이터 바이닝'이라고도 불러.
데이터를 다룰 때, 숫자들의 크기가 제각각이면 모델이 제대로 학습하기 어려울 수 있어. 마치 키가 150cm인 친구랑 200cm인 친구가 같이 달리기를 하는데, 키 차이 때문에 200cm 친구가 더 빨리 달릴 거라고 착각하는 것처럼 말이야. 그래서 데이터의 단위를 맞춰주는 스케일링이 필요해.
...이번 시간에는 문자로 된 데이터를 컴퓨터가 알아들을 수 있게 숫자로 바꾸는 방법을 배울 거야. 특히 '성별', '직업', '지역'처럼 순서가 없거나 있어도 숫자로 표현하기 애매한 범주형 데이터를 어떻게 다루는지 알아볼 거야.
범주형 데이터는 크게 두 가지로 나눌
...이제 드디어 모델을 만들기 바로 전 단계인 데이터 분리를 할 거야! 이건 마치 시험 보기 전에 공부할 내용이랑 답지를 따로 나누는 거랑 똑같아.