데이터 원천 관리
어디서 들어오는 데이터인지 한 곳에서 안다.
DB · API · 파일 · 스트림을 커넥터로 등록하고 스키마와 갱신 주기를 원천 단위로 관리한다. 원천이 바뀌면 어떤 파이프라인이 깨지는지 등록 시점에 드러난다.
- 커넥터 등록 · 자격증명 분리 보관
- 스키마 변경 감지와 영향 범위 추적
- 수집 주기 · 증분 기준 설정
Flow
단계마다 도구를 갈아타면 그 사이가 사각지대가 된다. 한 흐름으로 두면 어디서 끊겼는지가 바로 보인다.
수집
Ingest
가공
Transform
적재
Store
마트
Serve
API
Deliver
Features
어디서 들어오는 데이터인지 한 곳에서 안다.
DB · API · 파일 · 스트림을 커넥터로 등록하고 스키마와 갱신 주기를 원천 단위로 관리한다. 원천이 바뀌면 어떤 파이프라인이 깨지는지 등록 시점에 드러난다.
수집과 가공을 흐름으로 본다.
원천에서 마트까지의 변환을 DAG 로 정의하고 스케줄 · 재시도 · 백필을 붙인다. 실패한 지점과 그 아래로 번진 범위를 같은 화면에서 확인한다.
쓰는 사람 기준으로 잘라 둔다.
팀 · 용도별 마트를 정의하고 갱신 주기와 품질 기준을 함께 건다. 지표 정의를 마트 안에 두어 부서마다 숫자가 달라지는 일을 막는다.
만든 데이터를 쓸 수 있게 내보낸다.
마트를 그대로 REST 엔드포인트로 노출하고 인증 · 쿼터 · 버전을 게이트웨이에서 건다. 검색용 엔드포인트도 같은 경로 위에 올라간다.
Structure
원본을 지우지 않고 쌓아 두면 해석이 틀렸을 때 되돌아갈 곳이 남는다. 정제와 가공은 그 위에 얹는다. 아래층을 건너뛴 숫자는 나중에 반드시 대가를 치른다.
검색이나 문맥 조회처럼 모델이 끼는 작업도 결국 이 층 구조 위에서 돈다. 저장소를 하나 더 두는 대신 마트 옆에 둔다.
들어온 형태를 훼손하지 않고 쌓는다. 나중에 해석이 바뀌어도 되돌아갈 자리가 남는다.
표준 스키마로 맞추고 중복 · 결측을 정리한다. 조직이 합의한 사실은 여기에 있다.
용도에 맞게 좁혀 낸 층. 대시보드도 API 도 검색도 이 층을 본다.