전체 글
어쩌다 시간이얼마 전 연말 회고를 끝낸 것 같은데 왜 인지 세 달이 벌써 흘러 글또가 마무리되는 시간이 되었다. 글또에서 다행히 이탈되지 않고 끝까지 오기는 했으나 최선을 다해 임했던 건 아니었던 것 같다. 그럼에도 뭐 퍽 나쁘지 않은 글또의 6개월이었다. 근황글또를 시작할 때 즈음에는 나의 분석가로서 커리어와 강점에 대한 고민이 깊었다. 글또를 하는 6개월간 내가 경험해보고 싶던 모델링이나 분석 업무의 비중이 늘었고 그 과정에서 시행착오를 거치며 성장했다는 느낌을 받았다. 아직은 공부하고 실패를 겪으며 성장하는 단계에 있지만 단순한 불안이 아니라, 나아갈 방향을 가지고 있다는 생각에 꽤 기분 좋은 요즘이다. 글쓰기처음 글또를 시작하던 시기에는 블로그에 글을 올리는 것에 어색함이 컸다. 사실상 개인 노..
들어가며지난번 글이 인과추론의 컨셉정도를 설명했다면, 이번 글에서는 기초적인 개념들을 하나씩 살펴보겠습니다. 이런 개념을 살펴보는 것이 지루한 과정이긴 하지만 한 번은 정리해 보고 가면 추후에 꺼내 보기도 좋으니까요! :) 아 그리고 저는 실무로 통하는 인과추론 with 파이썬 이라는 책을 공부하며 내용을 정리하고 있어, 대부분 책 내용을 간단히 메모하는 정도로 글을 쓰고 있으니 참고 부탁드립니다. 인과모델인과 문제를 해결하기 위해 문제를 정형화된 표기법으로 정의할 필요가 있습니다. 인과추론에서는 인과모델을 활용해 이를 표기합니다.인과모델은 아래의 구성요소를 활용해 할당 메커니즘을 나타냅니다.𝑢 : 모델 외부의 변수 (외생변수)𝒇 : 변수간 관계를 나타내는 매핑함수← : 할당인과관계는 비가역성을 가짐..
배경앞선 글에서 uplift모델의 구성을 아주 간략히 살펴보고 실무에 적용해 봤습니다. 그 결과는 크게 좋지 못했는데, 긍정적으로 보자면 모델의 대략적인 설계와 예제만 보고 적용가능한 일반적인 ML과 달리 uplift모델을 사용하기 위해서는 인과추론에 대한 이해가 필요하다는 깨달음을 얻을 수 있는 시간이었습니다. 다만 이런 공부를 좀 더 일찍 시작해 사전에 알고 있었으면 어땠을까 하는 아쉬움도 많이 남습니다.사족이 길었는데, 뭐 지금부터라도 공부하면 되는거 아니겠습니까. 이런 계기로 많이들 스터디하시는 "실무로 통하는 인과추론"을 공부하는 내용을 기록해 보겠습니다. 인과와 상관"인과" (원인과 결과)와 "상관"(서로 영향을 미침)이 다르다는 점은 통계학을 처음 배우면서, 또 통계학이 아니더라도 일..
배경최근 사내의 스터디를 통해 업리프트 모델(Uplift Model)을 처음 접하게 되었습니다. 실무에서 더욱 꽤나 유용하게 쓰일 수 있는 모델로 보여, 활용을 위해 아래 유튜브 영상을 참고하여 개념을 간략히 정리해 보았습니다.🔗 참고 영상: Uplift Modeling Overview블로그 : https://juanitorduz.github.io/uplift/이제 업리프트 모델이 무엇이며, 어떻게 활용할 수 있는지에 대해 알아보겠습니다.(혹시 제 설명이 잘못된 부분이 있다면 편하게 말씀 부탁드립니다!) Uplift 모델이란?업리프트 모델(Uplift Model) 은 주로 마케팅 분야에서 활용되는 모델로, 제한된 자원을 어떤 그룹에게 배분해야 가장 효과적으로 사용할 그룹을 선정하는 데 사용되는 모델입..
1. 들어가며최근 모델을 도커로 컨테이너화 하고 배포하는 업무를 진행하고 있습니다. 개인적으로 아직 도커가 좀 서툰편이라 업무 중 배운 점들을 정리하고 추후에도 참고해보고자 글로 남겨봅니다. 2. 도커(Docker)란도커(Docker)는 애플리케이션을 컨테이너라는 단위로 패키징하여 어떤 환경에서도 동일한 환경을 기반으로 실행할 수 있도록 해주는 플랫폼입니다.기존의 가상화 기술(VM)은 각각의 어플리케이션을 실행하기 위해 게스트별 OS를 별도로 설치되어 효율적이지 못했던 한계가 있었으나, 도커는 이를 개선해 OS설치 없이 각 어플리케이션별 독립된 환경인 컨테이너를 제공합니다. 도커의 호스트 OS가 리눅스로 이루어져 있어 Guest가 동일하게 리눅스 계열의 OS를 사용한다면 큰 문제가 없지만, 그렇지 않을 ..
1. 비모수 검정을 사용하는 이유 지난번 글 ([가설 검정] 집단 간 평균 차이 검정 t-test)에서 살펴본 바와 같이 t-test를 수행하기 위해서는 검증하고 자하는 데이터가 t-test의 세 가지(정규성, 독립성, 등분산성) 사전 가정을 만족해야 합니다.만약 데이터가 이를 만족하지 않는 경우 t-test를 통해 데이터를 검정하는 것은 검정 결과에 대한 신뢰도를 떨어트립니다. 이때 우리가 사용할 수 있는 방법을 비모수 검정이라 합니다. 2. 비모수 검정의 개념비모수 검정은 t-test와 같은 모수 검정의 사전 가정인 데이터의 분포에 대한 가정 없이 사용할 수 있는 검정 방법입니다. 이 방법은 평균을 사용하는 모수 검정(t-test, z-test, ANOVA 등)과 달리 중앙값이나 값의 순위 (크기 차..
왜 벌서 24년이얼마 전 성과평과를 위해 1년간의 프로젝트를 정리하는 시간을 가졌다. 텍스트로 하나씩 정리하다 보니 1년이란 시간 동안 꽤 많은 일을 했었다는 생각도 들고 만족과 아쉬음이 교차해서 지나갔다(아니 근대 왜 벌써 1년이 지난 건지 알 수없다.). 회고도 하는 겸 개인적으로 만족스러웠던 부분과 아쉬운 부분을 정리해 보자. 만족스러운 부분1. 새로운 도메인을 다루며 많은 경험을 했다.올 상반기부터 카셰어링과 숙박 도메인에서의 분석 또 이를 결합하는 시도들을 함께했었다. 이 과정에서 마트 제작부터 분석, 모델링까지 모든 영역을 수행해 봤던 경험이 꽤 스스로를 성장시켰다. 특히 취소 패턴에 따른 이용형태를 분류하고, 단순 취소가 아닌 고객의 예약 시도의 종료 여부를 기준으로 설정한 이탈 지표를 만들..
1. 평균 차이에 대한 통계적 검정의 필요성가설 검정을 위해 둘 이상의 집단을 비교할 때 가장 기초적이며 쉬운 방법은 두 집단의 평균가 차이를 보이는지 여부를 확인하는 것입니다. 평균이라는 개념은 매우 일반적이며 이를 비교하는 것을 “왜 통계적으로 검정해야하는 문제인가?”는 의문을 가질 수 있습니다. 하지만, 평균은 데이터의 편향이나 이상치에 큰 영향을 받는 지표입니다. 즉, 위 사진과 같이 같은 평균 값을 가지더라도 두 집단의 분포는 크게 다를 수 있습니다. 이런 상황에서는 두 집단의 평균이 같다는 이유로 두 집단이 동일한 특성을 가진다고 말하기에는 어려움이 있습니다. 따라서, 평균을 비교할 때는 데이터의 분포, 이상치, 그리고 변동성 등을 고려해야 하며, 이러한 요소들을 반영하기 위해 t-test와..
1. 가설 검정?가설검정이란 특정 주장이나 예측이 데이터에 의해 사실인지 확인하는 과정입니다. 이것을 조금 쉽게 생각해 보면 특정 문제에 대해 실험자의 주장이나 인사이트를 데이터로 측정 가능한 문장으로 만든 것을 가설이라 칭하며, 이를 통계적인 방법으로 검증하는 것이 가설 검정이라 할 수 있습니다.이러한 가설 검정은 데이터 분석가에게 데이터 기반 의사결정의 핵심적 도구이며, 단순한 수치비교가 아닌 자신의 주장이나 인사이트를 통계적으로 검정해 설득력을 가지게 하는 수단입니다. 개인적으로 가설 검정에 대해 한번 정리해 놓자는 생각이 있었는데 이번 기회를 통해 2~3번에 거쳐 데이터의 형태나 분석 상황에 맞는 가설 검정 방식에 대한 개념과 코드 스니펫을 포스팅하려합니다. 그 첫 번 글로 가설 설정과 가설 ..



