| 일 | 월 | 화 | 수 | 목 | 금 | 토 |
|---|---|---|---|---|---|---|
| 1 | 2 | 3 | 4 | 5 | ||
| 6 | 7 | 8 | 9 | 10 | 11 | 12 |
| 13 | 14 | 15 | 16 | 17 | 18 | 19 |
| 20 | 21 | 22 | 23 | 24 | 25 | 26 |
| 27 | 28 | 29 | 30 |
- vim
- io
- Ollama
- pandas
- DataFrameGroupBy
- RandomAccessFile
- json schema
- PowerShell
- scikit-learn
- vscode
- 정렬
- scaler
- Typescript
- docker
- CSS
- UV
- curl
- 이미지
- FileChannel
- Docker Compose
- fit_transform
- Java
- yaml
- json
- Vite
- cli
- podman
- tauri
- Python
- Webpack
- Today
- Total
목록pandas (7)
워로디스
1. 입력: 함수에 무엇이 들어오는가Series.apply()df["a"].apply(func)func에는 df["a"]의 값 하나씩 들어온다.def func(x): # x = 개별 값 return ...예:df["a"].apply(lambda x: x * 2)a가 다음과 같다면:102030함수는 개념적으로 다음처럼 호출된다.func(10)func(20)func(30)DataFrame.apply(axis=1)df.apply(func, axis=1)func에는 행 하나씩 들어온다.각 행의 타입은 Series이다.def func(row): # row = 한 행 전체 return ...예:df.apply( lambda row: row["a"] + row["b"], axis=1)..
DataFrameGroupBy 객체는 그대로 출력해도 내부 데이터가 보이지 않습니다.grouped = df.groupby("지역")print(grouped)# 대신 그룹 구조를 볼지, 각 그룹의 실제 데이터를 볼지, 집계 결과를 볼지에 따라 확인 방법을 선택하면 됩니다.1. 그룹 이름과 행 위치 확인: .groupsgrouped.groups예를 들어:{ "부산": Index([2, 3], dtype="int64"), "서울": Index([0, 1], dtype="int64")}각 그룹에 어떤 원본 인덱스가 포함됐는지 확인할 수 있습니다.그룹 키만 보고 싶다면:grouped.groups.keys()list(grouped.groups)2. 각 그룹의 실제 데이터 확인: 반복문가장 확실한 방법입니..
stack() / unstack()은 행과 열의 계층을 서로 이동시키는 함수입니다. 특히 MultiIndex가 있는 데이터를 변형할 때 사용합니다.핵심적으로 보면:stack() : 열 → 행 인덱스unstack() : 행 인덱스 → 열1. stack()은 언제 쓰나?가로로 넓게 퍼진 데이터를 세로로 길게 바꿀 때 사용합니다.import pandas as pddf = pd.DataFrame({ "국어": [90, 80], "수학": [85, 95]}, index=["철수", "영희"])print(df) 국어 수학철수 90 85영희 80 95df.stack()철수 국어 90 수학 85영희 국어 80 수학 95dtype: int64즉, 과목이 열에 ..
Pandas 라이브러리에서 데이터프레임의 구조를 변환할 때 사용하는 pivot과 pivot_table 메서드의 핵심 원리와 차이점, 그리고 올바른 사용 기준을 정리합니다.1. 피벗(Pivot)의 기본 원리피벗은 세로로 길게 나열된 데이터(Long format)를 가로로 넓은 교차표 형태(Wide format)로 재구조화하는 작업입니다. 이 과정에서 기존 데이터프레임의 컬럼들은 다음과 같이 3가지 역할로 재배치됩니다.Index (행 인덱스): 지정한 컬럼의 고유 값들이 새로운 데이터프레임의 세로축(행 기준)이 됩니다.Columns (열 헤더): 지정한 컬럼의 고유 값들이 가로로 펼쳐져 새로운 데이터프레임의 가로축(컬럼 이름)이 됩니다.Values (데이터 값): Index와 Columns가 만나는 교차점(..
Pandas에서 데이터프레임을 출력할 때 줄바꿈이 발생하는 것은 콘솔창의 기본 출력 너비가 제한되어 있기 때문입니다. 이를 해결하기 위해 Pandas의 set_option 함수를 사용하여 출력 설정을 변경할 수 있습니다.1. 출력 너비(Width) 확장데이터프레임이 줄바꿈 없이 가로로 넓게 출력되도록 전체 출력 폭을 늘리는 설정입니다. 숫자는 콘솔에 표시될 수 있는 문자(Character)의 개수를 의미합니다.import pandas as pd# 콘솔 출력 너비를 1000자로 확장 (필요에 따라 숫자 조절 가능)pd.set_option('display.width', 1000)2. 최대 출력 컬럼 수(Max Columns) 해제너비를 늘려도 전체 컬럼 수가 많을 경우, 줄바꿈 대신 중간 컬럼이 ...으로 ..
1. 관점의 차이: 방향성 vs 라벨 위치Pandas에서 메서드의 성격에 따라 axis를 바라보는 관점이 달라집니다.연산 함수 (sum, mean 등): 데이터를 계산하기 위해 "어느 축의 방향으로 이동할 것인가?"를 지시합니다.구조 변경 함수 (drop): 데이터를 삭제하기 위해 "어느 축에 있는 이름표(Label)를 찾을 것인가?"를 지시합니다.2. drop 함수에서의 axis 적용drop 메서드에서 axis는 특정 라벨을 찾기 위해 검색해야 할 인덱스(목차)의 대상을 지정합니다.drop(라벨, axis=0)탐색 대상: 0번 축 (행 인덱스, Row Index 묶음)수행 결과: 지정한 이름표를 찾아 해당 가로줄(행) 전체를 삭제합니다.drop(라벨, axis=1)탐색 대상: 1번 축 (컬럼 이름, C..
1. 전체 코드def remove_outliers_iqr(df, cols=None, k=1.5): """ IQR 기준으로 이상치를 제거하는 함수 df : pandas DataFrame cols : 이상치를 검사할 컬럼 목록. None이면 모든 수치형 컬럼에 적용 k : IQR에 곱할 계수. 일반적으로 1.5 사용 """ if cols is None: cols = df.select_dtypes(include="number").columns Q1 = df[cols].quantile(0.25) Q3 = df[cols].quantile(0.75) IQR = Q3 - Q1 lower = Q1 - k * IQR upper = Q3..