본문 바로가기
반응형

전체 글156

stepwise (스텝와이즈) 변수 선택 종류 스텝와이즈는 “설명변수 후보가 많을 때, 예측력과 해석력을 최대화하는 소수의 변수만 고르는 절차”입니다주로 선형회귀·로지스틱회귀에서 쓰이며, 통계적 검정 또는 정보준거(AIC/BIC)를 기준으로 변수를 추가/제거합니다 언제 쓸까요?변수 후보가 많고, 해석 가능한 소수의 변수 집합이 필요할 때데이터가 그리 크지 않고, **고전적 선형/일반화선형모형(GLM)**을 빠르게 탐색하고 싶을 때보고서/논문 등에서 명확한 선택 절차를 제시해야 할 때단, 예측 정확도가 최우선이면 LASSO/Elastic Net, 트리계열 모델과의 비교를 권장 기준(Criterion)p-value 기반: 유의수준(예: 0.05)으로 변수 추가/제거 결정AIC (Akaike Information Criterion): 적합도–복.. 2025. 11. 10.
Matplotlib vs Seaborn vs Plotly 언제 어떤 걸 써야할까 데이터 분석을 하다 보면, “이 그래프는 어떤 라이브러리로 그려야 하지?”라는 고민을 한 번쯤 하게 됩니다Python에서 가장 많이 쓰이는 시각화 도구는 바로 Matplotlib, Seaborn, 그리고 Plotly인데요이 세 가지는 모두 데이터를 ‘보여주는’ 도구지만, 목적과 강점이 꽤 다릅니다 1. Matplotlib — 시각화의 기본기, 모든 그래프의 뼈대Matplotlib은 가장 기본적인 시각화 라이브러리입니다다른 라이브러리들이 대부분 Matplotlib 위에 만들어졌을 정도로 시각화의 ‘근본’이에요import matplotlib.pyplot as pltplt.figure(figsize=(6,4))plt.plot([1, 2, 3, 4], [2, 4, 6, 8], marker='o')plt.ti.. 2025. 10. 21.
Feature Importance vs SHAP 변수 중요도 진짜 해석법 모델링을 하다 보면 항상 궁금해지는 게 있죠.“이 변수들이 결과에 얼마나 영향을 줬을까?”이를 해석하기 위해 흔히 Feature Importance(변수 중요도)를 봅니다 하지만 최근에는 단순 중요도보다 더 정교한 해석 방법으로SHAP (SHapley Additive exPlanations)이 널리 사용되고 있어요특히 저도 이번 논문에서 같이 적용했답니다ㅎㅎ 오늘은 두 방법의 차이와, 같은 모델에서도 왜 해석이 달라지는지를 비교해볼게요 1. Feature Importance란?모델이 학습할 때 각 변수의 기여도를 계산해“이 변수가 결과 예측에 얼마나 영향을 미쳤는가”를 수치로 보여주는 지표입니다.=예를 들어 랜덤포레스트에서의 중요도는“해당 변수가 불순도를 얼마나 많이 줄였는가”**로 계산돼요 from.. 2025. 10. 13.
StandardScaler vs MinMaxScaler 스케일링이 모델에 미치는 진짜 영향 머신러닝 모델을 만들다 보면 반드시 거치는 단계가 있습니다바로 “스케일링(Scaling)”, 즉 데이터 크기를 맞춰주는 작업이에요하지만 많은 분들이 “그냥 해주면 좋은 거 아닌가?” 정도로만 알고 있죠오늘은 가장 대표적인 두 가지 스케일러인StandardScaler와 MinMaxScaler의 차이,그리고 모델에 실제로 어떤 영향을 주는지를 함께 살펴볼게요 1. 왜 스케일링이 필요한가?머신러닝 모델은 대부분 **거리(distance)**나 **가중치(weight)**를 기반으로 계산합니다.그런데 각 변수의 단위가 다르면,변수 값의 범위키(cm)150 ~ 190몸무게(kg)40 ~ 90나이(세)10 ~ 80이럴 때 값의 크기가 큰 변수(예: 나이)가모델 학습에서 더 큰 영향력을 갖게 돼요즉, 모델이 실제.. 2025. 10. 6.
반응형