목록2026/07 (9)
co-code 님의 블로그
1과목개인정보보호법개인정보 : 신분관계, 내면의 비밀, 심신의 상태, 사회 경력, 경제 관계, 기타 생체 인식 정보, 위치 정보 등개인정보 처리자의 의무사항개인 정보의 수집, 이용 및 재공, 관리(보관), 파기2과목상관계수 (r)두 개의 연속형 변수에 대해 두 변수 간에 관계가 있는지, 어떤 관계가 있는지 알아보기 위해 사용[-1,1]의 범위를 가짐r>0 : 양의 상관관계rr=0 : 두 변수 사이의 선형적 관계가 없다병렬 차트여러 범주의 데이터를 비교하기 위해 사용차원을 행, 측정값을 열에 배치하거나 그 반대로 배치하여 차트 제작그룹화된 막대 형식(병렬 막대 차트)으로 표현되기도 함층화 표본 추출 방법모집단을 둘 이상의 층으로 나누고 각 층마다 독립적으로 단순 임의 추출집단 내 동질적, 집단 간 이질적 ..
Edward Thufte가 제시한 스토리텔링 시각화 기본 원칙시각적인 비교 강화인과관계의 제시다차원 변수의 표시효과적인 정보 전달을 위한 데이터, 텍스트, 그래픽 배치명확한 콘텐츠의 질, 연관성, 진실성 전달공간적 순서의 배치정량적 자료에 대한 양적 정보의 표현Colin이 제안한 데이터 분석의 해석과 시각화 절차데이터 수집·저장예비 처리 변형그래픽 엔진을 이용한 시각화시각인지 프로세싱시각화 데이터의 배열 방법위치(지리적 or 공간적 위치)알파벳(알파벳으로 데이터 배열)시간(시간 순서에 따른 데이터)카테고리(데이터 속성·중요도·유사한 주제)위계(데이터 값, 중요도 순서에 따른 배열)데이터 시각화 시간 시각화(분절형/이산형) : 막대 그래프, 누적 막대 그래프, 점 그래프(연속형) 선 그래프, 영역 차트공간..
판별 분석사용되는 집단 변수는 범주형 변수, 판별 변수는 연속형 변수 or 범주형 변수판별 함수의 수 ≤ min( (집단 수 - 1), 판별 변수의 수)판별 분석 위해 사용한 개체들은 다변량 정규 분포이어야 한다는 가정 필요한별함수를 만든 후에 판별함수에 새로운 개체 특성을 대입하여 어떤 집단에 속할지 결정하는 것Clustering(군집 분석)가장 흔히 사용되는 Clustering 기법은 K-meansHierarchical Clustering(계층적 군집 분석)은 Clustering을 먼저 수행 한 후 집단 개수 설정비Nonhierarchical Clustering(비계층적 군집 분석) ⊃ K-medoids각 개체간의 유사도 혹은 비유사도를 기반을 그룹에 할당하여 분석하는 기법R에서 데이터 마트 구축에..
변수의 분류 종속 변수영향을 받는 변수 (반응 변수)실험에서 결과의 예측 변수독립 변수영향을 주는 변수 (설명 변수)실험에서 연구자에 의해 조작이 되는 변수외생 변수독립 변수와 종속 변수 간의 상관관계가 없는데 있는 것처럼 보이도록 만드는 변수통제를 통해서 가식적 관계 제거해야 함억압 변수독립변수와 종속변수 간에 상관관계가 있는데 없는 것처럼 보이도록 만드는 변수데이터 정제데이터 변환데이터의 형태를 변환하거나 분산이 용이한 형태로 변환ETL(Extract, Transform, Load) 통해 동일한 형태로 변환데이터 교정결측치 변환, 이상치 제거, 노이즈 데이터 교정비정형 데이터 수집 시 반드시 수행데이터 통합기존 유사 데이터와 연계 또는 통합Legacy System 데이터와 통합하는 경우 수행이상값 검..
데이터 전처리 vs 데이터 후처리데이터 전처리데이터 유형 변환데이터 필터링데이터 정제데이터 후처리데이터 변환데이터 통합데이터 축소DBMS 활용 데이터 수집 기술Apache Sqoop고정된 컬럼에 데이터 저장(like 테이블, 행과 열에 의해 데이터 속성이 구별됨)Hadoop 플랫폼과 연계 가능Apache Hadoop과 연걔한 대량 데이터 전송 가능병렬로 데이터 전송Apache Flume대용량의 로그 데이터를 효과적으로 수집, 집계, 이동안정적이고 신뢰성 있는 분산 서비스 제공스트리밍 데이터 기반대량의 이벤트 데이터(네트워크 트래픽, 소셜 데이터, 이메일 메시지 등) 전송 가능신뢰성, 확장성, 효율성 있는 수집 방법Scrapy웹사이트를 crawling하고 구조화된 데이터 수집데이터 마이닝, 정보 처리, 이..
