Glacien로그인

Data Platform

데이터를 모으는 일부터
쓰이는 형태로 내보내는 일까지

수집기 따로, 스케줄러 따로, 웨어하우스 따로, API 서버 따로 두지 않는다. 원천 등록부터 파이프라인, 마트, 엔드포인트 발행까지 한 층 위에서 굴러간다.

Flow

다섯 단계가 끊기지 않는다

단계마다 도구를 갈아타면 그 사이가 사각지대가 된다. 한 흐름으로 두면 어디서 끊겼는지가 바로 보인다.

  1. 01

    수집

    Ingest

  2. 02

    가공

    Transform

  3. 03

    적재

    Store

  4. 04

    마트

    Serve

  5. 05

    API

    Deliver

Features

네 가지를 각각 관리하고, 하나로 연결한다

01

데이터 원천 관리

어디서 들어오는 데이터인지 한 곳에서 안다.

DB · API · 파일 · 스트림을 커넥터로 등록하고 스키마와 갱신 주기를 원천 단위로 관리한다. 원천이 바뀌면 어떤 파이프라인이 깨지는지 등록 시점에 드러난다.

  • 커넥터 등록 · 자격증명 분리 보관
  • 스키마 변경 감지와 영향 범위 추적
  • 수집 주기 · 증분 기준 설정
02

데이터 파이프라인 관리

수집과 가공을 흐름으로 본다.

원천에서 마트까지의 변환을 DAG 로 정의하고 스케줄 · 재시도 · 백필을 붙인다. 실패한 지점과 그 아래로 번진 범위를 같은 화면에서 확인한다.

  • DAG 정의 · 의존 기반 실행 순서
  • 스케줄 · 재시도 · 구간 백필
  • 실행 이력과 데이터 리니지
03

데이터 마트 관리

쓰는 사람 기준으로 잘라 둔다.

팀 · 용도별 마트를 정의하고 갱신 주기와 품질 기준을 함께 건다. 지표 정의를 마트 안에 두어 부서마다 숫자가 달라지는 일을 막는다.

  • 용도별 마트 정의 · 파티셔닝
  • 지표 정의와 품질 검증 규칙
  • 임베딩 · 벡터 인덱스도 같은 스키마에서
04

API

만든 데이터를 쓸 수 있게 내보낸다.

마트를 그대로 REST 엔드포인트로 노출하고 인증 · 쿼터 · 버전을 게이트웨이에서 건다. 검색용 엔드포인트도 같은 경로 위에 올라간다.

  • 마트 → 엔드포인트 자동 발행
  • 토큰 인증 · 레이트 리밋 · 버전 고정
  • 검색 · 문맥 조회 엔드포인트 동거

Structure

층으로 쌓고,
층을 건너뛰지 않는다

원본을 지우지 않고 쌓아 두면 해석이 틀렸을 때 되돌아갈 곳이 남는다. 정제와 가공은 그 위에 얹는다. 아래층을 건너뛴 숫자는 나중에 반드시 대가를 치른다.

검색이나 문맥 조회처럼 모델이 끼는 작업도 결국 이 층 구조 위에서 돈다. 저장소를 하나 더 두는 대신 마트 옆에 둔다.

  • Lake원본 그대로

    들어온 형태를 훼손하지 않고 쌓는다. 나중에 해석이 바뀌어도 되돌아갈 자리가 남는다.

  • Warehouse정제된 사실

    표준 스키마로 맞추고 중복 · 결측을 정리한다. 조직이 합의한 사실은 여기에 있다.

  • Mart쓰기 위한 형태

    용도에 맞게 좁혀 낸 층. 대시보드도 API 도 검색도 이 층을 본다.

데이터 팀의 도구를 한 층으로

지금 쓰는 원천을 그대로 등록하는 것부터 시작하면 된다.