목록전체 글 (36)
co-code 님의 블로그
Edward Thufte가 제시한 스토리텔링 시각화 기본 원칙시각적인 비교 강화인과관계의 제시다차원 변수의 표시효과적인 정보 전달을 위한 데이터, 텍스트, 그래픽 배치명확한 콘텐츠의 질, 연관성, 진실성 전달공간적 순서의 배치정량적 자료에 대한 양적 정보의 표현Colin이 제안한 데이터 분석의 해석과 시각화 절차데이터 수집·저장예비 처리 변형그래픽 엔진을 이용한 시각화시각인지 프로세싱시각화 데이터의 배열 방법위치(지리적 or 공간적 위치)알파벳(알파벳으로 데이터 배열)시간(시간 순서에 따른 데이터)카테고리(데이터 속성·중요도·유사한 주제)위계(데이터 값, 중요도 순서에 따른 배열)데이터 시각화 시간 시각화(분절형/이산형) : 막대 그래프, 누적 막대 그래프, 점 그래프(연속형) 선 그래프, 영역 차트공간..
판별 분석사용되는 집단 변수는 범주형 변수, 판별 변수는 연속형 변수 or 범주형 변수판별 함수의 수 ≤ min( (집단 수 - 1), 판별 변수의 수)판별 분석 위해 사용한 개체들은 다변량 정규 분포이어야 한다는 가정 필요한별함수를 만든 후에 판별함수에 새로운 개체 특성을 대입하여 어떤 집단에 속할지 결정하는 것Clustering(군집 분석)가장 흔히 사용되는 Clustering 기법은 K-meansHierarchical Clustering(계층적 군집 분석)은 Clustering을 먼저 수행 한 후 집단 개수 설정비Nonhierarchical Clustering(비계층적 군집 분석) ⊃ K-medoids각 개체간의 유사도 혹은 비유사도를 기반을 그룹에 할당하여 분석하는 기법R에서 데이터 마트 구축에..
변수의 분류 종속 변수영향을 받는 변수 (반응 변수)실험에서 결과의 예측 변수독립 변수영향을 주는 변수 (설명 변수)실험에서 연구자에 의해 조작이 되는 변수외생 변수독립 변수와 종속 변수 간의 상관관계가 없는데 있는 것처럼 보이도록 만드는 변수통제를 통해서 가식적 관계 제거해야 함억압 변수독립변수와 종속변수 간에 상관관계가 있는데 없는 것처럼 보이도록 만드는 변수데이터 정제데이터 변환데이터의 형태를 변환하거나 분산이 용이한 형태로 변환ETL(Extract, Transform, Load) 통해 동일한 형태로 변환데이터 교정결측치 변환, 이상치 제거, 노이즈 데이터 교정비정형 데이터 수집 시 반드시 수행데이터 통합기존 유사 데이터와 연계 또는 통합Legacy System 데이터와 통합하는 경우 수행이상값 검..
데이터 전처리 vs 데이터 후처리데이터 전처리데이터 유형 변환데이터 필터링데이터 정제데이터 후처리데이터 변환데이터 통합데이터 축소DBMS 활용 데이터 수집 기술Apache Sqoop고정된 컬럼에 데이터 저장(like 테이블, 행과 열에 의해 데이터 속성이 구별됨)Hadoop 플랫폼과 연계 가능Apache Hadoop과 연걔한 대량 데이터 전송 가능병렬로 데이터 전송Apache Flume대용량의 로그 데이터를 효과적으로 수집, 집계, 이동안정적이고 신뢰성 있는 분산 서비스 제공스트리밍 데이터 기반대량의 이벤트 데이터(네트워크 트래픽, 소셜 데이터, 이메일 메시지 등) 전송 가능신뢰성, 확장성, 효율성 있는 수집 방법Scrapy웹사이트를 crawling하고 구조화된 데이터 수집데이터 마이닝, 정보 처리, 이..
재귀 함수함수가 자기 자신을 다시 호출하는 방법기동 조건 : 언제 멈출 것인가? 반드시 지정재귀 단계 : 문제를 똑같은 형태의 더 작은 문제로 쪼개어 자기 자신을 호출하는 부분예시 문제1. 카운트 다운 : '3, 2, 1 발사' 출력# 방법 1) for문for i in range(3,-1,-1): if i != 0: print(i) else: print('발사')>>> 3 2 1 발사# 방법 2) 재귀함수def countdown(n): #n : 카운트다운 시작 수치 #기동 조건 : n이 0이 되면 함수 호출을 그만 둔다. (발사 출력을 생성) if n==0: print('발사') return #수행하는 작업 print..
텍스트가 token이라는 수치로 변환 되고 각 token은 Word Embedding을 통해 벡터로 변환됨 순환 하지 않고 데이터를 한번에 병렬 처리할 수 있어 순환 신경망(RNN)과 LSTM(장단기 메모리) 보다 학습 및 훈련 속도가 획기적으로 빨라짐문장의 앞 뒤 거리에 상관없이 단어 간의 관계를 정확하게 이해할 수 있음구성 : 인코더(Encoder) + 디코더(Decoder) 인코더(Encoder) : 데이터 이해 디코더(Decoder) : 결과 생성import torch import pandas as pd import torch.nn as nn import torch.optim as optim from torch.utils.data import Dataset, DataLoaderfrom transf..
Doc2VecWord2Vec의 확장판기본적인 매개변수, 속성, 메서드는 Word2Vec와 같다.추가적인 부부분이 존재매개변수dm기본값 : 1학습 알고리즘을 선택1 : PV-DM0 : PV-DBOWdm_mean기본값 : 0문장 벡터의 계산 방식 (PV-DM)1 : 벡터들의 평균0 벡터들의 합산범위가 커지는 경우가 발생 -> 노이즈로 인한 성능의 저하가 발생할 수 있다.dm_concat기본값 : 0PV-DM에서 문서 벡터와 문장 벡터를 결합할 것인가?결합을 하는 경우 차원이 급격하게 증가dbow_words기본값 : 0PV-DBOW 사용 시 단어 벡터도 동시에 학습할 것인가?alpha | min_alpha기본값 : 0.025 | 0.0001보폭의 크기반복학습을 할 때 경사하강법의 기본적인 메뉴얼너무 크면 둔..
