Databricks 실시간 데이터 처리 이렇게 바뀐다 — RisingWave 통합으로 대폭 강화
RisingWave는 이벤트 스트림 데이터 처리 및 관리 플랫폼으로, 오늘 Databricks와의 새로운 통합을 발표했습니다. Databricks의 오픈 포맷 이니셔티브의 주요 런치 파트너로서, 이제 RisingWave는 강력한 스트림 처리 기능을 Databricks Data Intelligence Platform과 직접 연결합니다. 이를 통해 기업들은 가장 최신의 데이터를 활용해 훨씬 더 간단하게 엔드 투 엔드 분석 및 AI 애플리케이션을 구축할 수 있습니다.
이번 통합은 오픈 테이블 포맷인 Apache Iceberg와 Databricks의 향상된 Unity Catalog를 기반으로 합니다. 이를 통해 RisingWave의 실시간 스트리밍 데이터와 Databricks의 배치 데이터를 단일한 거버넌스 환경에서 원활하게 공존하고 함께 쿼리할 수 있습니다.
많은 조직들이 배치 처리와 AI를 위한 강력한 Lakehouse를 보유하고 있지만, 실시간 소스에서 신선한 데이터를 지속적으로 공급하는 것은 복잡하고 비용이 많이 듭니다. 이로 인해 이벤트가 발생한 시점과 해당 데이터가 유용해지는 시점 사이에 답답한 지연이 발생합니다. 이번 통합은 이러한 문제를 근본적으로 해결하며, RisingWave와 Databricks 간에 강력한 양방향 데이터 통로를 제공합니다.
주요 기능:
이번 파트너십은 두 가지 강력한 워크플로우를 가능하게 합니다.
Databricks 관리 Iceberg 테이블로 스트리밍 ETL
이제 RisingWave는 Databricks 플랫폼의 고성능 스트리밍 엔진이 될 수 있습니다. Kafka나 Kinesis와 같은 소스에서 데이터를 수집하고, RisingWave에서 간단한 SQL을 사용하여 복잡한 상태 기반 처리를 수행한 후, 처리된 결과를 Databricks의 Managed Iceberg 테이블에 직접 저장할 수 있습니다. 스트리밍 ETL을 위한 완벽한 솔루션입니다.
Unity Catalog를 통한 RisingWave 관리 Iceberg 테이블의 통합 거버넌스
이번 통합은 RisingWave에서 관리하는 Iceberg 테이블에도 Databricks Unity Catalog의 거버넌스를 확장합니다. 이러한 RisingWave 테이블은 자체 메타데이터 관리를 위해 JDBC, REST, 또는 Glue Catalog를 사용할 수 있으며, 이를 Databricks에서 외부 테이블로 등록하면 Unity Catalog를 통해 검색 및 관리가 가능합니다. 즉, RisingWave가 실시간으로 생성하는 materialized view는 Databricks 내에서 표준 테이블처럼 접근 가능하며, Databricks의 보안 및 거버넌스 프레임워크와 동일하게 적용됩니다.
Databricks 생태계에 RisingWave가 필요한 이유
RisingWave는 단순한 스트림 프로세서가 아닙니다. PostgreSQL 호환 스트리밍 데이터베이스로서 단순함과 강력함을 동시에 제공합니다. Databricks 사용자에게 RisingWave는 다음과 같은 주요 이점을 제공합니다:
진정으로 간단한 스트림 처리: RisingWave의 핵심 강점은 스트리밍 데이터에 대해 materialized view를 생성하는 것입니다. 복잡한 Java나 Scala 코드를 작성할 필요 없이, 익숙한
CREATE MATERIALIZED VIEW구문으로 처리할 수 있습니다. RisingWave는 이러한 뷰를 극도로 낮은 지연 시간으로 자동으로 증분 업데이트합니다.비용 효율적인 고성능: Rust로 처음부터 설계된 RisingWave는 컴퓨트와 스토리지가 분리된 아키텍처를 갖추고 있어 높은 성능과 높은 자원 효율성을 동시에 제공합니다. 이를 통해 대규모 실시간 분석도 경제적으로 수행할 수 있습니다.
양방향 데이터 흐름: 이번 통합을 통해 RisingWave의 실시간 스트림에 Databricks의 히스토리컬 데이터나 차원 데이터를 결합할 수 있어, 더욱 컨텍스트가 풍부한 의사결정을 지원합니다.
(Quote from RisingWave 임원)
"Databricks와의 파트너십을 통해 저희 스트리밍 데이터베이스를 현대 데이터 스택의 핵심으로 가져올 수 있게 되어 매우 기쁩니다."라고 RisingWave의 [이름, 직함]는 말했습니다. "업계가 Iceberg와 같은 오픈 스탠다드로 전환하는 것은 저희가 전적으로 지지하는 방향이며, Databricks는 그 변화의 선두에 있습니다. 이번 통합으로 Databricks 사용자는 스트림 처리의 복잡함을 극복하고 실시간 대시보드부터 인스턴트 피처 엔지니어링까지 SQL만으로 실시간 애플리케이션을 구축할 수 있게 됩니다."
(Quote from Databricks 임원)
"Databricks Data Intelligence Platform은 데이터가 어디에 있든 고객이 모든 데이터를 활용할 수 있도록 설계되었습니다."라고 Databricks의 [이름, 직함]는 말했습니다. "저희 오픈 생태계는 RisingWave와 같은 파트너에 의해 강화됩니다. RisingWave의 최고 수준의 스트리밍 데이터베이스는 고객이 실시간 데이터를 손쉽게 처리하여 Lakehouse로 전달하고, 이를 AI 및 고급 분석에 즉시 활용할 수 있도록 돕습니다. 저희는 고객이 이 통합을 통해 어떤 혁신을 만들어낼지 매우 기대하고 있습니다."
데이터 팀을 위한 새로운 기회
RisingWave와 Databricks의 결합은 데이터 팀에게 다음과 같은 가능성을 제공합니다:
실시간 피처 개발: 실시간 데이터로 RisingWave에서 지속적으로 피처를 계산하고, 이를 즉시 ML 모델에 사용할 수 있도록 Databricks로 스트리밍합니다.
스트리밍으로 ETL/ELT 현대화: 느린 배치 작업을 RisingWave의 SQL 기반 스트리밍 파이프라인으로 대체하여, 신선하고 정제된 데이터를 몇 초 만에 Databricks Lakehouse로 전달합니다.
실시간 Lakehouse 대시보드 구동: RisingWave에서 실시간으로 처리한 최신 데이터를 바탕으로 Databricks에서 운영 대시보드와 모니터링 시스템을 구동합니다.
분석 통합: RisingWave의 실시간 운영 데이터와 Databricks의 히스토리컬 데이터를 함께 분석하여 종합적인 인사이트를 확보합니다.
RisingWave 소개
RisingWave는 이벤트 스트림 처리 및 관리 플랫폼입니다. 실시간 데이터 수집, 스트림 처리, 데이터 저장 및 저지연 서빙을 위한 통합 경험을 제공합니다. RisingWave는 글로벌 커뮤니티의 지원을 받고 있으며, 엔터프라이즈 기업들이 실시간 분석 대시보드, 스트리밍 ETL 파이프라인, 운영 모니터링 애플리케이션을 구축하는 데 채택하고 있습니다.
