co-code 님의 블로그
co-code
« 2026/08 »
| 일 |
월 |
화 |
수 |
목 |
금 |
토 |
| |
|
|
|
|
|
1 |
| 2 |
3 |
4 |
5 |
6 |
7 |
8 |
| 9 |
10 |
11 |
12 |
13 |
14 |
15 |
| 16 |
17 |
18 |
19 |
20 |
21 |
22 |
| 23 |
24 |
25 |
26 |
27 |
28 |
29 |
| 30 |
31 |
|
|
|
|
|
관리 메뉴
co-code 님의 블로그
빅데이터 수집 및 저장 계획 오답 개념 정리 본문
빅분기 공부/1과목
빅데이터 수집 및 저장 계획 오답 개념 정리
co-code
2026. 7. 3. 20:00
- 데이터 전처리 vs 데이터 후처리
- DBMS 활용 데이터 수집 기술
- Apache Sqoop
- 고정된 컬럼에 데이터 저장(like 테이블, 행과 열에 의해 데이터 속성이 구별됨)
- Hadoop 플랫폼과 연계 가능
- Apache Hadoop과 연걔한 대량 데이터 전송 가능
- 병렬로 데이터 전송
- Apache Flume
- 대용량의 로그 데이터를 효과적으로 수집, 집계, 이동
- 안정적이고 신뢰성 있는 분산 서비스 제공
- 스트리밍 데이터 기반
- 대량의 이벤트 데이터(네트워크 트래픽, 소셜 데이터, 이메일 메시지 등) 전송 가능
- 신뢰성, 확장성, 효율성 있는 수집 방법
- Scrapy
- 웹사이트를 crawling하고 구조화된 데이터 수집
- 데이터 마이닝, 정보 처리, 이력 기록 같은 다양한 애플리케이션에 적용
- 파이썬 기반의 프레임워크
- 데이터 수집이 용이하고 로깅 지원
- 데이터 적제 수립 과정
- 요건 정의
- 데이터 적제 주기에 있어서 분석 요건을 도출하는 단계
- 다양한 이슈에 따라서 요건 정의가 될 수 있는 항목들을 선정하여 중요한 요건 정의 항목부터 추출하고 검토해야 함
- 수행 방안 설계
- 분석 요건에 따라 정확한 수행방안을 설계/기술하는 단계
- 데이터 분석을 구체적으로 수행하기 위해서 데이터의 탐색적 분석을 수행하면서 모델링을 위한 가설 설정
- 데이터 요건 확정
- 요건 도출과 수행방안 설계 후 실행하는 단계
- 요건에 어떻게 접근할 것인지, 이를 통해 어떤 정량적/정성적 효과가 나올지에 대해 기획해야 함
- 모델링
- 요건 정의와 확정을 통해 정의된 요건에 따라 상세 분석을 기법을 적용해서 모델을 개발하는 단계
- 모델링 마트 설계와 구축 및 탐색적 분석과 유의 변수 도출, 모델링 성능 평가의 단계를 가짐
- 데이터 저장 방식의 기능성 측면
- 데이터 모델
- 데이터를 테이블로 정리하고 가능한 경우 관계형 DB 이용
- 문서 중심의 데이터 모델로 전환이 필요한 경우 MongoDB 이용
- 확장성
- Column-Oriented DB 이용
- 확장성 보장을 위해 HBase, Cassandra, Hyper Table 활용
- 트랜잭션 일관성
- 데이터 수정 / 삭제 등의 작업이 빈번한 경우 NoSQL보다 관계형 데이터베이스 활용
- 질의지원
- 우수한 질의(Query) 인터페이스가 필요한 경우 MongoDB 이용
- 뷰(View) 개념을 활용하는 경우 CouchDB 이용
- 접근성
- 대부분의 라이브러리용 드라이버를 지원하는 MongoDB 이용
- 데이터 검증을 위한 자동화 도구의 기능
- 진단 대상 데이터 베이스 관리 : 대상 데이터 베이스 등록 및 정보 자동 수집
- 진단 대상 테이블 관리 : 업무별 진단 대상 테이블 우선순위 및 자동 추천
- 진단 유형 관리 : 진단 대상 컬럼별 분석 유형 자동 질의/관리
- 품질 진단 : 품질 진단 Job 자동 생성, 작업 스케줄 예약 관리
- 진단 모니터링 : 실시간 품질진단 모니터링, 장애/오류 발견 홍보
- 진단 결과 관리 : 다각적인 진단결과 제공, 오류 유형 자동 분류
- 오류 원인 관리 : 오류의 원인과 분석 내용 제공
- 보고서 작성 : 데이터 품질 관리 분석 및 지침 등 보고서 자동 생성
-