전체 글 21

코딩테스트) 프로그래머스 level2 뒤에 있는 큰 수 찾기+근황+마일리지

요즘 뭐하나면요 5월달에 해커스 오픽 강남 강의 듣고 있고(멀관에서 오픽 보면 40% 싸게 볼 수 있습니다) 또 방학때 뭐 해볼려고 이것저것 넣어보고있어요. 다음달 말에 빅데이터기사 실기가 있어서 작업 유형1 문제 풀고있습니다. 이기적 카페에서 프린트 하면서 풀고있어요. 빅데이터 실기 끝나면 정보처리기사 실기 7월 22일인가 그때 시험 준비해야합니다. 정처기 실기가 코딩이 많이 나오기 때문에 + 코테 준비 하기 위해서 파이썬을 두잇 알고리즘 책 으로 알고리즘 공부하고있습니다. 한 80페이지 했나 ㅇㅅㅇ 빅분기 실기가 끝나면 취업할때까지 파이썬만 할 수 있어서 좋긴합니다. 다음학기가 아무거나2 + 전공1이라 취업준비 하면서 코테 준비 많이 해놔야죠 근데 알고리즘만 할수는 없으니 프로그래머스 문제 한개씩 풀..

카테고리 없음 2023.05.17

11장

11.1.1 나이브 베이즈 나이브 베이즈 분류는 각 클래스(카테고리 또는 레이블)에 대한 사전 확률과 특성(Feature)이 주어졌을 때, 조건부 확률을 계산하여 입력 데이터를 가장 확률이 높은 클래스로 분류하는 방식입니다. 홀드아웃방식으로 데이터를 2개로 나눌껀데 70%, 30%, 각각의 비율로 나눈다. 훈련에 사용할 데이터는 70%로 사용을 하고 명령은 매우 간단하다. 훈련과 테스트 데이터 모두에 대해 예측을 생성할수 있고 아래에 보면 1개 빼고 일치하였다. 정확도도 다음과 같다. f1 score도 계산할수있고 히트맵으로 시각화 하면 다음과 같은데 왼쪽 대각선이 일치하는것이다. 그림을 살펴보면 suburb_mix에서 오차가 조금 있는걸 확인할수있다. 일반적으로 알고있는 혼동행렬에서 사용되는 preci..

카테고리 없음 2023.04.11

10장 비지도 클러스터링

고객 세그먼트(유사한 특성을 가진 고객 그룹)를 통한 분석하고 예측하기 10.1 세그멘테이션 지도 - 결과그룹에 대해 암 = 답을 알고 있음 비지도 - 결과그룹에 대해 모름 10.2 세그멘테이션 데이터 다음 데이터는 연령,성별,가구소득,자녀수,주택소유,구독상태를 알수있다. 비지도학습과 그룹구성원 예측을 해볼려고 한다. 10.3 클러스터링 1. 계층적방법 데이터를 트리 구조로 모델링하여 수행함 2. k-means - 중심점을 사용함 데이터 변환 성별을 부울변수로 변환하고 gender를 삭제함 데이터의 크기를 비슷하게 만듬 10.3.2 계층적 클러스터링 우리가 알고있는 유클리드 거리는 다음과 같다. pdist함수를 통해서 여러개의 유클리드 거리도 계산이 가능하다 . 하지만 숫자일때만 사용이 가능함으로 범주형..

카테고리 없음 2023.04.11

9장

perform - 성과 leader - 리더 latest-최신 fun-재미 serious-대단함 bargain -할인 value-가치 trendy-트렌디 rebuy -재구매 brand -브랜드 종류 이렇게 10개의 브랜드 종류를 x 100명이 수행했다 그래서 총 1000명이다 z-정규화 정규화공식인 x-평균/표준편차를 사용해서 정규화 한다 당연히 평균은 0 이다 정규분포곡선은 대칭임으로 중간값도 0이다 corr로 상관관계 표를 그려보자 앞서 브랜드가 10개니까 브랜드를 그룹으로 지정하구 평균을 내봤다. 이걸로 히트맵을 그려보자 해석해 보자 초록색일수록 높고 갈색일수록 낮다. 한눈에 알기 쉬운건 없지만 j 같은경우에는 fun은 높지만 나머지 부분은 다른브랜드보다 낮다는 것을 알수있다. 9.2 주성분 분석 ..

카테고리 없음 2023.04.11

8장

8장에서는 3가지 모델을 다룹니다. 온라인 매장 및 매장 내 거래 요약 데이터를 pairgrid를 통해서 시각화 해봅시다. 문제가 많아 보이네요 ..... 1. 박스 콕스 변환 - 데이터를 정규분포에 가깝게 만드는것 이를 통해 변수의 선형성을 높이고, 모델의 예측력을 개선할 수 있습니다. 박스콕스 변환에서는 0이 있으면 문제가 되기 때문에 1을 더합니다.(log를 쓰기 때문이죠 ) 그리구 scipy 패키지의 boxcox 함수를 사용하여, 입력된 데이터를 박스-콕스 변환합니다. 이 함수는 데이터의 최적 람다 값을 찾아 변환을 수행합니다. 변환된 데이터와 최적 람다 값이 반환됩니다. 온라인 방문은 관련성이 적네요 ... 근데 박스콕스 변환에서 문제가 있어요.. 공선성은 독립 변수들 간의 상관 관계가 매우 높..

카테고리 없음 2023.04.04

7장 선형 모델

놀이공원데이터 - 상관관계를 분석할 예정입니다. 서비스의 특징에 대한 고객 만족도와 전반적인 경험 간의 관계를 발견해볼려고 합니다. 하나만 bool이고 나머지는 inf나 float로 구성 데이터 변수 파악을 위해 시각화를 함 하나만 bool이기 때문에 0 or 1로 만들고 7.2.1 예비 데이터 검사 데이터 시각화를 진행함 clean과 ride가 너무 완벽함 ㅎㅎ 강한 양의 상관관계 *여기서 잠깐 상관관계 설명 0.9>r 이상이면 매우 높은 상관관계를 가집니다. r=0.81임으로 따로 조치를 취하지는 않음 ride-x축, overall-y축으로 산점도를 그려보기 7.2.3 전체적인 만족도와 놀이기구 만족도에 관련된 선형 모델을 추정하고 싶음 rides-coef가 1.2887 이모델은rides만족도에대해9..

카테고리 없음 2023.04.03

6장

통계검정 1. 카이제곱 검정 카이제곱 독립성 검정 2개의 변수가 연관이 있는지 판단 pvalue=0.85198가 나온다. 일반적으로p 값이0. 10(90%) 또는 0.05(95%) 보다 작으면 그룹간에 차이가 있음을 보여줌 p117 이항 검정(binomial) *신뢰구간이 95%라는 의미 모평균을 포함할 확률이 95%가 아니라 (동일한 크기의 )같은 방법으로 표본을 추출했을때, 100개의 신뢰구간중 모평균을 포함한 신뢰구간들의 숫자가 95개가 된다. T-검정(평균과 평균을 검정) 집을 가지고 있는 사람과 가지고 있지않는 사람들의 소득의 mean과 std를 계산해보자 근데 여기서 주택소유가 소득차이에서 변수가 되는지 궁금하다. p-value가 0.05보다 낮으므로 귀무가설이 기각된다. = 통계가 유의미 하..

카테고리 없음 2023.04.03

[파이썬으로 하는 마케팅 연구와 분석] 4장

4.1 데이터 4.2 산점도가 있는 변수 간의 연관성 탐색 ㄴㅅ 하나하나 해석해보자. 221은 2x2그림에서 1번째 그림을 의미하는 것이다. x,y축은 지정해주고 color는 none으로 edge color는 darkblue로 해주고 s는 마커의 크기인데 8로 해주자. 이렇게 하면 산점도 해석이 완료된다 ㅎㅎ 숫자만 나와있어서 잘 모르겠다. 시각화를 해볼까? 5장에서는 개선된 시각화를 보여줍니다.

카테고리 없음 2023.03.29