2022-12-06 데이터마이닝_12

Featured image for 2022-12-06 데이터마이닝_12

  기말고사로 밀린 포스팅 ^^ 1. 감정 추측 글의 분위기를 추측한다. 영어만 가능하다. imagine dragons의 노래 3곡의 분위기를 측정해보았다. 2. Wikipedia 사용 Orange에서 제공하는 Wikipedia 기능을 사용하면 위키에 있는 검색결과를 바로 코퍼스로 가져올 수 있다. 위키피디아에 teemo 검색. ^오^

2022-11-29 데이터마이닝_11

Featured image for 2022-11-29 데이터마이닝_11

기말고사 준비로 밀린 포스팅 ^^ 1. 문자열 분석 word cloud를 클릭해서 보면 아래와 같은 결과를 볼 수 있다. preprocess를 한 것과 안 한 것의 차이다. in, the, to, of와 같은 불필요한 것들을 제거한다. (이 외에도 preprocess의 역할은 더 다양하다.) 2. 실습_워드클라우드 자기가 스스호 선정한 주제로 직접 위드 클라우드 그려보기. 출처 : https://ftw.usatoday.com/lists/league-of-legends-patch-notes-preseason-2023 롤 프리시즌 패치노트에 … 더 읽기

2022-11-26 데이터마이닝_10

Featured image for 2022-11-26 데이터마이닝_10

  1. 비지도 학습 비지도 학습으로 k-Means와 Hierarchical Clustering을 사용해 봤다. 가. k-Means fixed: 5 : 이미지를 5가지로 분류 나. Hierachical Clustering 이미지를 분류할 경우에는 Ward를 선택한다고 한다. 2. 실습_비지도 학습 이미지 다운로드 : 구글 fixed: 2 : 이미지를 2가지 분류 맥주와 소주 이미지를 가지고서 한번 분류하도록 시켜보았다. 오… 생각보다 똑똑한데? 고든 램지도 극찬한 CASS … 더 읽기

2022-11-26 데이터마이닝_9

Featured image for 2022-11-26 데이터마이닝_9

1. Test & Score 이렇게만 보면 잘 모르겠으니깐…. 출처 : https://orangedatamining.com/widget-catalog/evaluate/testandscore/ 가. 실습 직접 데이터를 구해서 학습시키는 실습을 해보았다. 데이터 출처 : https://www.data.go.kr/data/15070340/fileData.do 주야, 요일, 발생지시도, 가해자법규위반, 도로 형태, 가해자_당사자 종별을 통해서 사고유형을 올바르게 찾아내는지 확인해보자. 위와 같이 아이콘들을 배치/연결한다. 모델로 Tree, Random Forest. kNN을 사용한다. 사고 사망 통계의 여러 요소 중 ‘사고유형-대분류’를 타겟하여 진행했다. … 더 읽기

2022-11-13 데이터마이닝_8

Featured image for 2022-11-13 데이터마이닝_8

1. 연관규칙 2 가. 실습 1 (1) 질문? 왜 힘들게 하나하나 수동으로 factor로 바꿔주어야 하는가? stringsAsFactors = TRUE로 한 번에 바꿔도 되지 않는가? 나. 실습 2 (1) 결과 해석 lhs, rhs, support, confidence, coverage, lift, count 순서로 출력 1 ~ 17번 : 특정한 연관관계 없음.18번 : ‘고급 자전거’를 선택하는 선택한 사람이 ‘제주도에 바다가 보이는 20평땅’을 … 더 읽기

2022-11-13 데이터마이닝_7

Featured image for 2022-11-13 데이터마이닝_7

1. 연관규칙 대량의 데이터에서 빈번하게 발생하는 데이터의 패턴을 찾는 것. 맥주를 사는 사람은 마른안주도 함께 구매한다. 장바구니 분석이라고도 함. 출처 : https://welcome-to-dewy-world.tistory.com/61 가. 실습 baseball, basketball 그리고 soccer에 들어있는 0과 1을 숫자가 아닌 factor로 인식하도록 한다. read.csv(…., stringsAsFactors = true) 옵션을 사용하지 않은 것은 string 타입이 아니기 때문이다. 사용하면 이상하게 동작한다. 주의할 것. 출처 : … 더 읽기

2022-10-14 데이터마이닝_6

Featured image for 2022-10-14 데이터마이닝_6

1. K-means 대표적인 비지도 학습. 데이터를 이용해서 k개로 분류. k-평균 알고리즘(K-means clustering algorithm)은 주어진 데이터를 k개의 클러스터로 묶는 알고리즘이다. 각 클러스터와 거리 차이의 분산을 최소화하는 방식으로 동작한다. 각 그룹의 중심 (centroid)과 그룹 내의 데이터 오브젝트와의 거리의 제곱합을 비용 함수로 정하고, 이 함숫값을 최소화하는 방향으로 각 데이터 오브젝트의 소속 그룹을 업데이트해 줌으로써 클러스터링을 수행하게 된다. 알고리즘은 … 더 읽기

2022-10-06 데이터마이닝_5

Featured image for 2022-10-06 데이터마이닝_5

1. Random Forest 기계 학습에서의 랜덤 포레스트는 분류, 회귀 분석 등에 사용되는 앙상블 학습 방법의 일종이다. 훈련 과정에서 구성한 다수의 결정 트리로부터 부류(분류) 또는 평균 예측치(회귀 분석)를 출력함으로써 동작한다. ( 출처 : https://ko.wikipedia.org/wiki/랜덤_포레스트 ) ( 출처 : https://eunsukimme.github.io/ml/2019/11/26/Random-Forest/ ) 임의의 여러 개의 Decision tree를 만들기에 Random forest라고 하는 것 같다. Random Forest의 구체적인 원리는 수업의 … 더 읽기

2022-09-28 데이터마이닝_4

Featured image for 2022-09-28 데이터마이닝_4

의사결정 트리 (Decison Tree) 결정 트리(decision tree)는 의사 결정 규칙과 그 결과들을 트리 구조로 도식화한 의사 결정 지원 도구의 일종이다. 모델 학습 시 각 변수마다 중요도(feature importance)를 계산한다. 출처 : https://data-make.tistory.com/75 출처 : https://ko.wikipedia.org/wiki/결정_트리 조건부 추론 트리 (Conditional Inference Tree) 조건부 추론 트리는 의사결정 트리(Decision Tree) + 통계적 유의성 확인(변수의 유의성)이 가능한 수치를 제공해주는 Tree다. … 더 읽기

2022-09-21 데이터마이닝_3

Featured image for 2022-09-21 데이터마이닝_3

wordcloud 데이터를 시각화하는 패키지 중 하나다. 위와 같은 단어로 이뤄진 이미지를 만들 수 있다. 참고 : https://cran.r-project.org/web/packages/wordcloud/wordcloud.pdf 패키지 설치 패키지 로드 새로 켜서 사용할 때마다 로드해주기. wordcloud 실행 table 함수는 ‘분할표’를 출력해주는 함수입니다. (단어의 수를 세어줌) ?????????????? 네? wordcloud 폰트 깨짐 문제 폰트 깨짐 ㅅㄱ 맥북 m1으로 rstudio로 wordcloud를 실행할 경우 한글 폰트를 못 찾아서 … 더 읽기