Databricks: как data lakehouse стал бизнесом вокруг данных и AI

Databricks: як data lakehouse став бізнесом навколо даних і AI

Когда семь исследователей из Калифорнийского университета в Беркли в 2013 году основали Databricks, они не планировали строить очередного ИТ-гиганта. Они просто хотели, чтобы технология обработки больших данных Apache Spark, которую сами же и создали в университетской лаборатории AMPLab, стала пригодной для обычных компаний, а не только для инженеров из Facebook или Google. За десять с лишним лет эта идея превратилась в бизнес с миллиардной выручкой и оценкой, превышающей 60 миллиардов долларов по итогам раунда 2024 года, — одну из самых дорогих частных технологических компаний мира.

Эта история интересна не только масштабом. Databricks — редкий пример того, как академический open-source проект стал фундаментом целой категории рынка, а компания вокруг него придумала новый архитектурный подход — data lakehouse — и заставила весь рынок говорить на своем языке. Здесь также видно, как бизнес модели известных компаний: как устроены платформы ритейл вырастают из исследовательских проектов и становятся платформенным бизнесом.

Что такое Databricks и чем компания занимается

Databricks — это американская компания со штаб-квартирой в Сан-Франциско, которая разрабатывает облачную платформу для работы с данными, аналитики и искусственного интеллекта. Платформа объединяет в одной среде хранение данных, их обработку, бизнес-аналитику, машинное обучение и работу с генеративным AI.

Проще говоря, Databricks продает компаниям единое «рабочее место» для всех, кто работает с данными:

  • инженеры данных строят конвейеры сбора и очистки информации;
  • аналитики пишут SQL-запросы и создают отчеты;
  • исследователи данных обучают модели машинного обучения;
  • команды AI создают приложения на базе больших языковых моделей.

Ключевая деталь: Databricks не является облачным провайдером. Платформа работает поверх инфраструктуры AWS, Microsoft Azure и Google Cloud, поэтому клиент хранит данные в собственном облачном аккаунте, а Databricks предоставляет вычислительный слой и программные инструменты. Это принципиально отличает ее от закрытых решений, где данные приходится переносить в чужую систему.

История компании: от университетской лаборатории до рыночной категории

История бренда Databricks начинается с проекта Spark, который 2009 года запустили в лаборатории AMPLab Беркли. Главной проблемой тогдашних систем обработки больших данных, в частности Hadoop MapReduce, была медлительность: данные постоянно записывались на диск и считывались обратно. Spark предложил обработку в оперативной памяти, что ускоряло многие задачи в десятки раз.

Университетская лаборатория, где родился проект Apache Spark

2010 года Spark стал проектом с открытым кодом, а 2013-го перешел под эгиду Apache Software Foundation. Тогда же семеро ключевых авторов проекта — Али Годси, Ион Стойка, Матей Захария, Патрик Венделл, Рейнольд Синь, Арслан Таваколи-Шираджи и Энди Конвински — основали компанию Databricks, чтобы коммерциализировать технологию. Годси, который на тот момент изучал бизнес в Стэнфорде, стал генеральным директором и занимает эту должность до сих пор.

Несколько вех из истории компании показывают, как она эволюционировала:

  • 2013–2015 — запуск облачной платформы вокруг управляемого Spark, первые крупные раунды инвестиций от Andreessen Horowitz и NEA;
  • 2016 — открытие кода Delta Lake, проекта, который добавил надежность транзакций к данным в хранилищах;
  • 2018 — запуск MLflow, открытого инструмента для управления жизненным циклом моделей машинного обучения;
  • 2019–2020 — компания начинает продвигать концепцию lakehouse как новую архитектуру данных;
  • 2021 — рекордный раунд инвестиций в 1,6 миллиарда долларов при оценке 38 миллиардов;
  • 2023 — приобретение стартапа MosaicML примерно за 1,3 миллиарда долларов и резкий разворот в сторону генеративного AI;
  • 2024 — раунд в 10 миллиардов долларов, один из крупнейших в истории венчурного финансирования, при оценке около 62 миллиардов долларов.

Отдельное направление истории — международная экспансия. Компания открыла офисы в Европе, Азии и на Ближнем Востоке, а 2023 года выкупила долю в команде разработчиков, связанной с проектом индексов для аналитики. Хотя Databricks — компания американская по происхождению, ее инженерные центры распределены по нескольким континентам. Похожий по масштабу влияния эффект в потребительской сфере создают знаковые бренды: apple nike lego ferrari coca cola, хотя Databricks формирует стандарты в более узкой профессиональной среде.

Что такое lakehouse и почему эта идея изменила рынок

Чтобы понять бизнес Databricks, нужно разобраться в проблеме, которую она решила. До появления lakehouse компании вынуждены были поддерживать две разные системы.

Символическое изображение концепции lakehouse — дом у озера данных

Первая — data warehouse, хранилище данных. Структурированные таблицы, быстрые SQL-запросы, надежность — идеально для отчетности, но дорого и плохо подходит для необработанных данных, видео, текстов или машинного обучения. Вторая — data lake, озеро данных: дешевое хранение любых файлов в облаке, гибкость для исследователей, но хаос с качеством данных и отсутствие гарантий целостности. В результате данные непрерывно копировались между системами, версии расходились, а поддержка стоила целое состояние.

Lakehouse — это попытка снять эту дилемму: хранить данные в открытых форматах в дешевом облачном хранилище, но добавить поверх них слой, который обеспечивает транзакции, схемы, контроль версий и быструю аналитику — то, что раньше умели только хранилища. Технической основой этого слоя в Databricks стал Delta Lake с его журналом транзакций и поддержкой ACID-операций.

Идея оказалась настолько удачной, что термин перешел в общеупотребительный словарь индустрии: сегодня о lakehouse-архитектуре говорят и конкуренты, и аналитики Gartner, и сами клиенты. Для Databricks это лучшая форма маркетинга — компания не просто продает продукт, она определила категорию, внутри которой конкурирует.

Как работает платформа Databricks на практике

Архитектурно платформа состоит из нескольких слоев, и понимание этих слоев объясняет, почему клиенты готовы платить за нее немалые деньги.

Серверная инфраструктура облачной платформы обработки данных

Вычисления: управляемый Spark

Пользователь описывает задачу — например, обработать ночной поток транзакций или подготовить обучающую выборку — а платформа сама создает кластер нужного размера, выполняет работу и выключает ресурсы. Ручное администрирование серверов, которое когда-то отнимало львиную долю времени команд по данным, исчезает. Дополнительно Databricks разработала собственный оптимизированный движок Photon, который ускоряет SQL-запросы по сравнению со стандартным Spark.

Хранение: Delta Lake и открытые форматы

Данные остаются в облачном хранилище клиента в открытых табличных форматах. Это принципиальный момент для крупных компаний: если завтра они решат уйти от Databricks, данные не придется экспортировать из проприетарной системы. Формат открытый, экосистема инструментов вокруг него большая.

Управление: Unity Catalog

Отдельный слой отвечает за права доступа, аудит, каталогизацию данных и моделей. Для банков, страховых и медицинских компаний, где вопрос «кто видел эти данные и когда» имеет регуляторное значение, это не опция, а требование.

Аналитика и AI

Поверх хранения работают Databricks SQL для аналитических запросов, инструменты дашбордов, среда для машинного обучения на базе MLflow и набор Mosaic AI для работы с генеративными моделями: тонкой настройки, развертывания и контроля качества. После приобретения MosaicML компания также начала разрабатывать собственные открытые модели — в частности семейство DBRX, выпущенное 2024 года.

Бизнес-модель: на чем зарабатывает Databricks

Бизнес-модель Databricks — классическая для зрелого облачного софта: подписка с оплатой за фактическое потребление вычислений. Компания измеряет использование в собственных единицах — Databricks Units, привязанных к вычислительной работе, которую выполняет платформа. Чем больше данных обрабатывает клиент и чем сложнее его AI-задачи, тем больше счет — и тем больше ценность, которую он теоретически получает.

Такая модель имеет несколько важных последствий:

  • выручка растет вместе с клиентом: компания, начинающая с одного аналитического проекта, со временем переносит на платформу все больше процессов;
  • высокая доля повторных доходов: после внедрения миграция на другую платформу болезненна, поэтому клиенты остаются годами;
  • open source работает как воронка: бесплатные Spark, Delta Lake и MLflow создают привычку и экспертизу на рынке, а монетизируется управляемая корпоративная версия.

Этот подход — «открытое ядро, платное облако» — не уникален, но Databricks реализовала его эффективнее большинства конкурентов. Компания не подпадает под классическое определение SaaS в узком смысле, потому что продает не готовое приложение, а платформу, на которой клиенты строят собственные решения, поэтому ее часто относят к категории data platform.

Что касается финансов: Databricks остается частной компанией, поэтому точные цифры зависят от отчетности, которую она публикует выборочно. По публичным заявлениям, годовая выручка в текущем исчислении превысила 3 миллиарда долларов в 2024 году с ростом более 50% год к году. Обещания выхода на биржу звучат регулярно, но конкретных дат компания не называла — по состоянию на общедоступную информацию IPO остается вопросом времени и рыночной конъюнктуры.

Владельцы, руководство и инвесторы: кому принадлежит Databricks

Формально Databricks принадлежит ее акционерам: основателям, сотрудникам с опционами и венчурным фондам. Среди инвесторов компании — Andreessen Horowitz, New Enterprise Associates, Coatue, Tiger Global, фонды Fidelity и Franklin Templeton, а также стратегические корпоративные инвесторы: Microsoft, Amazon (через AWS), Google (через CapitalG), Nvidia и Salesforce. Присутствие в капитале сразу нескольких облачных гигантов, которые одновременно являются партнерами и отчасти конкурентами, — характерная черта современного рынка данных.

Контрольный пакет ни одному внешнему инвестору не принадлежит: стратегические решения принимают совет директоров и команда основателей во главе с Али Годси. Именно поэтому ответ на вопрос «кому принадлежит Databricks» звучит так: это независимая частная компания с распределенной структурой собственности, а не дочернее предприятие какого-либо техногиганта.

Страна происхождения — США: компания зарегистрирована в Делавэре по стандартной для американских стартапов схеме, штаб-квартира расположена в Сан-Франциско, штат Калифорния.

Кто конкурирует с Databricks и кто ее клиенты

Главным конкурентом Databricks считают Snowflake — компанию, пришедшую с противоположной стороны рынка: от аналитического хранилища данных к машинному обучению и AI. Databricks двигалась навстречу — от обработки данных и ML к SQL-аналитике. Столкновение этих двух платформ фактически определило развитие всего рынка корпоративных данных в 2020-х. Дополнительное давление создают облачные провайдеры с собственными сервисами — Google BigQuery, AWS Redshift, Microsoft Fabric.

Клиентами Databricks являются преимущественно крупные и средние компании со значительными объемами данных: банки, ритейлеры, телеком-операторы, фармацевтические компании, медиа. Компания заявляет о тысячах клиентов по всему миру, включая значительную долю корпораций из списка Fortune 500. Типичный сценарий внедрения выглядит так: сначала на платформу переносят один болезненный процесс — например, подготовку данных для кредитного скоринга или прогнозирования спроса, — а затем использование расширяется на всю организацию.

Почему Databricks делает ставку на искусственный интеллект

Генеративный AI изменил расклады на рынке данных, и Databricks отреагировала быстрее многих. Логика компании проста: качественная модель искусственного интеллекта требует больших объемов хорошо подготовленных данных, а именно этим Databricks и занимается последнее десятилетие. Платформа предлагает клиентам обучать и дорабатывать модели на собственных корпоративных данных, не отдавая их сторонним сервисам, — аргумент, который хорошо работает для регулируемых отраслей.

Инженеры анализируют результаты обучения AI-моделей

Приобретение MosaicML дало компании команду и инфраструктуру для тренировки больших моделей с нуля, а выпуск открытой модели DBRX стал сигналом рынку: Databricks хочет быть не только «хранилищем с вычислениями», а полноценным игроком среди AI-компаний. Удастся ли это в долгосрочной перспективе — открытый вопрос, потому что конкуренция в сфере искусственного интеллекта сейчас самая высокая в истории индустрии.

Интересные факты о Databricks

Несколько фактов, которые помогают лучше представить масштаб и характер компании:

  • Название Databricks — игра слов: «bricks» означает кирпичи данных, из которых строится платформа, а «data» указывает на сферу.
  • Apache Spark, созданный основателями компании, до сих пор остается одним из самых массовых инструментов обработки данных в мире, и его развитием Databricks занимается как ключевой участник сообщества.
  • Компания ежегодно проводит конференцию Data + AI Summit, которая собирает десятки тысяч участников и стала одним из главных событий индустрии данных.
  • Штат Databricks превышает несколько тысяч сотрудников в десятках стран, хотя еще десять лет назад это была команда из нескольких десятков инженеров.
  • Раунд инвестиций в 10 миллиардов долларов 2024 года вошел в перечень крупнейших венчурных сделок в истории.

Короткие ответы на частые вопросы

Databricks — что это за компания простыми словами?

Американская технологическая компания, которая продает облачную платформу, где предприятия хранят, обрабатывают и анализируют данные и создают на их основе модели искусственного интеллекта. Работает поверх AWS, Azure и Google Cloud.

Кто основал Databricks и когда?

Компанию основали в 2013 году семеро исследователей из Калифорнийского университета в Беркли — создатели проекта Apache Spark. Генеральным директором с самого начала является Али Годси.

Чем Databricks отличается от Snowflake?

Databricks исторически сильнее в инженерии данных и машинном обучении, Snowflake — в SQL-аналитике и простоте использования. Сегодня обе платформы активно вторгаются на территорию друг друга.

Является ли Databricks украинской или европейской компанией?

Нет. Страна происхождения Databricks — США, штаб-квартира в Сан-Франциско. В то же время компания имеет инженерные офисы во многих странах мира.

Можно ли пользоваться Databricks бесплатно?

Базовые open-source проекты — Apache Spark, Delta Lake, MLflow — бесплатны для всех. Управляемая платформа имеет пробный период и бесплатную версию с ограниченной функциональностью, но полноценное корпоративное использование оплачивается за потребленные вычисления.

Что стоит понять перед выбором платформы данных

Если вы оцениваете Databricks для собственной компании или просто изучаете рынок, практический вывод таков: платформа лучше всего раскрывается там, где есть большие объемы разнородных данных и потребность в машинном обучении или AI, а не только в отчетности. Для простой аналитики небольшой компании ее мощность может оказаться избыточной, а счет — неприятно неожиданным из-за модели оплаты за потребление.

Перед внедрением стоит посчитать ожидаемую нагрузку, сравнить ее с альтернативами и проверить, есть ли в команде специалисты, способные работать с платформой. Технология дает преимущество только тогда, когда под нее есть реальная задача и люди, которые умеют эту задачу решать.

Мария готовит познавательные материалы об истории компаний и брендов, происхождении названий и логотипов, развитии корпоративных структур, бизнес-моделей и маркетинговых подходов. В текстах она опирается на отчёты компаний, архивные материалы и профильные исследования, отделяя факты от рекламных утверждений.

Business Atlas
Добавить комментарий