Parquet 해부
열끼리 모아 저장하는 이유부터 덩어리·청크·페이지와 꼬리의 목차까지 Parquet 파일의 안쪽을 따라간다. min/max와 블룸 필터가 덩어리를 거르고, HTTP Range가 그 조각만 집어오는 과정을 애니메이션 일곱 개로 정리한다.
글 3편

열끼리 모아 저장하는 이유부터 덩어리·청크·페이지와 꼬리의 목차까지 Parquet 파일의 안쪽을 따라간다. min/max와 블룸 필터가 덩어리를 거르고, HTTP Range가 그 조각만 집어오는 과정을 애니메이션 일곱 개로 정리한다.

S3에 쌓아둔 발송 이력 JSON은 그대로 질의하기 어렵다. 서버리스 질의, 분석 플랫폼 적재, Parquet 변환, Iceberg 네 안을 상시 인프라·조회 비용의 모양·최신성 기준으로 저울질하고, 매일 새벽 Parquet으로 최신화하는 구조를 고른 이유를 정리한다.

발송 이력을 어디에 저장할지에 대한 고민이다. 관계형 DB, RDB·S3 직렬·SNS fan-out·Firehose를 놓고 따진 트레이드오프를 정리했다.