co-code 님의 블로그
co-code
« 2026/08 »
| 일 |
월 |
화 |
수 |
목 |
금 |
토 |
| |
|
|
|
|
|
1 |
| 2 |
3 |
4 |
5 |
6 |
7 |
8 |
| 9 |
10 |
11 |
12 |
13 |
14 |
15 |
| 16 |
17 |
18 |
19 |
20 |
21 |
22 |
| 23 |
24 |
25 |
26 |
27 |
28 |
29 |
| 30 |
31 |
|
|
|
|
|
관리 메뉴
co-code 님의 블로그
분석 모형 설계 오답 개념 정리 본문
빅분기 공부/3과목
분석 모형 설계 오답 개념 정리
co-code
2026. 7. 16. 23:57
- 판별 분석
- 사용되는 집단 변수는 범주형 변수, 판별 변수는 연속형 변수 or 범주형 변수
- 판별 함수의 수 ≤ min( (집단 수 - 1), 판별 변수의 수)
- 판별 분석 위해 사용한 개체들은 다변량 정규 분포이어야 한다는 가정 필요
- 한별함수를 만든 후에 판별함수에 새로운 개체 특성을 대입하여 어떤 집단에 속할지 결정하는 것
- Clustering(군집 분석)
- 가장 흔히 사용되는 Clustering 기법은 K-means
- Hierarchical Clustering(계층적 군집 분석)은 Clustering을 먼저 수행 한 후 집단 개수 설정비
- Nonhierarchical Clustering(비계층적 군집 분석) ⊃ K-medoids
- 각 개체간의 유사도 혹은 비유사도를 기반을 그룹에 할당하여 분석하는 기법
- R에서 데이터 마트 구축에 사용되는 패키지
-
- reshape
- melt()와 cast()를 이용해서 데이터를 재구성히거나 재정렬
- melt()
- 선택한 id 변수를 이용해서 나머지 변수들을 variable이라는 이름의 데이털로 만듦
- 모델링할 떄 유용
- cast()
- 원하는 형태와 함수를 이용해 데이터 요약
- 그대프를 시각화할 떄 적합
- sqldf
- step 1. SQL명령이 주어지면 자동으로 스키마 생성
- step 2. 데이터를 테이블로 로드한 후 SQL문 수행
- step 3. SQL 실행 결과를 다시 R로 로드
- plyr
- 두개 이상의 데이터 프레임을 병합하거나 분리해서 요약하고, 집계할 때 사용되는 패키지
- 데이터를 분리하고 처리한 다음 다시 결합
- 한꺼번에 여러 개의 통계치를 구할 수 있음
- NoSQL DBMS의 특징
- RDMS와 비교하여 상대적으로 제한이 덜한 데이터 모델
- Key-value, Column-oriented, Document-oriented, Graph-oriented 등의 모델링 기법 가능
- 두 개체의 관계가 1:1인 경우 어느 한 쪽의 속성에 링크로 저장하거나 하나의 테이블로 통합
- 두 개체의 관계가 1:n인 경우 Embedding 기법을 활용하여 테이블 생성
- MongoDB의 경우 DBMS가 자동으로 생성하는 id 식별자 이용 가능