판다스 데이터프레임 완전 정복: 왕초보도 엑셀처럼 쉽게 다루는 핵심 기술!
판다스, 데이터 프레임 정복하기! 🚀
안녕! 오늘은 파이썬으로 데이터를 다루는 데 꼭 필요한 판다스라는 도구를 배울 거야. 특히, 데이터 프레임이라는 걸 집중적으로 다뤄볼 건데, 이게 뭐냐면 엑셀처럼 표처럼 생긴 데이터를 쉽게 다룰 수 있게 도와주는 거야.
1. 판다스, 왜 필요할까? 🤔
판다스는 마치 요리할 때 칼, 도마처럼 데이터를 다루는 데 필요한 도구 모음집(라이브러리)이라고 생각하면 돼. 우리가 직접 모든 코드를 짜는 대신, 판다스가 미리 만들어 놓은 코드를 가져다 쓰면서 데이터를 쉽게 불러오고, 정리하고, 분석할 수 있게 해줘.
2. 판다스의 두 얼굴: 시리즈와 데이터 프레임 🎭
판다스에는 크게 두 가지 데이터 구조가 있어.
-
시리즈 (Series): 이건 마치 하나의 열(컬럼)이라고 생각하면 돼. 리스트랑 비슷한데, 각 데이터마다 번호(인덱스)가 자동으로 붙어.
```python
예시: 점수 시리즈 만들기
data = [10, 20, 30, 40]
s = pd.Series(data)
print(s)
```결과:
0 10 1 20 2 30 3 40 dtype: int64
여기서 0, 1, 2, 3은 자동으로 붙은 인덱스야.인덱스를 직접 지정할 수도 있어!
```python
예시: 과목별 점수 시리즈 만들기
data = {'국어': 90, '영어': 85, '수학': 95}
s_custom = pd.Series(data)
print(s_custom)
```결과:
국어 90 영어 85 수학 95 dtype: int64
이제 '영어' 점수를 알고 싶으면s_custom['영어']이렇게 부르면 돼! -
데이터 프레임 (DataFrame): 이게 오늘 주인공이야! 여러 개의 시리즈(열)를 모아서 만든 표 형태의 데이터야. 엑셀 시트랑 똑같다고 생각하면 돼.
```python
예시: 학생 정보 데이터 프레임 만들기
data = {
'이름': ['앨리스', '밥', '찰리'],
'나이': [20, 22, 21],
'점수': [85, 90, 78]
}
df = pd.DataFrame(data)
print(df)
```결과:
이름 나이 점수 0 앨리스 20 85 1 밥 22 90 2 찰리 21 78
3. 데이터 프레임, 어떻게 다룰까? 🛠️
데이터 프레임을 만들었으면 이제 이걸 가지고 놀아봐야겠지?
-
데이터 프레임의 일부 보기:
df.head(): 위에서부터 몇 개를 볼지 정할 수 있어 (기본값 5개).df.tail(): 아래에서부터 몇 개를 볼지 정할 수 있어 (기본값 5개).
-
데이터 프레임의 크기 확인:
df.shape: 행과 열의 개수를 알려줘. (행 개수, 열 개수)
-
데이터 프레임의 정보 요약:
df.info(): 데이터가 몇 개 있고, 각 열의 데이터 타입은 뭔지 알려줘. 결측치(값이 없는 것)가 있는지 없는지도 알 수 있어.df.describe(): 숫자 데이터에 대한 평균, 최소값, 최대값 등 기본적인 통계 정보를 보여줘.
-
특정 열(컬럼) 선택하기:
df['열이름']: 특정 열만 쏙 빼낼 수 있어.df[['열이름1', '열이름2']]: 여러 열을 동시에 선택할 수도 있어.
-
특정 행(로우) 선택하기:
df.iloc[행번호]: 행 번호로 특정 행을 선택할 수 있어.df.loc[인덱스이름]: 인덱스 이름으로 특정 행을 선택할 수도 있어.
-
결측치 확인하기:
df.isnull(): 각 셀이 결측치인지 아닌지 알려줘.df.isnull().sum(): 각 열마다 결측치가 몇 개인지 세어줘.
4. 꼭 기억해! 💡
- 판다스는 표 형태의 데이터를 다루는 데 최고야!
- 시리즈는 1차원 (하나의 열), 데이터 프레임은 2차원 (표)이야.
head(),tail(),shape,info(),describe(),isnull()같은 함수들을 잘 활용하면 데이터의 특징을 빠르게 파악할 수 있어.- 실제로 코드를 직접 써보고 실행해보면서 익히는 게 제일 중요해! 자격증 시험도 직접 코딩해야 하니까 꼭 연습하자!
오늘 배운 내용 꼭꼭 복습하고, 직접 코드를 만져보면서 판다스와 친해지길 바라! 😊