2026 年数据就绪指数:了解成功实现 AI 的基础

查看结果
| 技术

领先的数据团队如何使用 Apache Iceberg 和 Spark 构建 AI 就绪的管道

Pamela Pan headshot
Ying Chen
Akshat Mathur headshot
女人在厨房里看手机

两家全球企业在数据工程现代化以实现可扩展人工智能方面的经验教训

从预测性分析到生成式人工智能,每个企业都在寻求将数据转化为价值。但对于许多团队来说,真正的挑战在于表面之下——在使数据可用、可信和可扩展所需的数据工程工作中。在复杂环境中,工程师仍在使用遗留的表格格式拼接管道,跨工具复制逻辑,并在事后调整治理。这些低效率在每个阶段都造成阻碍,延迟了结果并限制了即使是最先进的人工智能和分析计划的影响。

对于希望简化数据工程堆栈并面向未来的企业来说,作为开放表格格式的 Apache Iceberg 和作为开放计算引擎的 Apache Spark 已被证明是一个强大的组合。它们共同提供了一个开放、可扩展且标准化的基础,用于处理和管理 PB 级数据——同时不牺牲治理、灵活性或性能。

在本博客中,我们将深入探讨两家全球性组织如何利用 Spark 和 Iceberg,借助 Cloudera 数据与人工智能平台,改造了他们的数据管道。我们将探讨他们如何将查询时间缩短 80%,统一团队工作流程,并加速从原始数据到 AI 智能的路径。

Vodafone Idea 如何将查询时间缩短 80%

Vodafone Idea 是印度三大主要电信公司之一,为 2.2 亿客户提供服务。该公司正面临规模问题:其基于 Hive 的数据湖已经膨胀到超过 17 PB,性能瓶颈正在危及关键业务运营。一些报告查询花费了超过 70 小时才完成!这导致合规、分析和监管报告延迟。

与其简单升级基础设施,Vodafone Idea 选择重新架构其数据平台。公司与 Cloudera 合作,利用 Iceberg 通过优化元数据和模式演化实现更快的查询,并在 Spark 上重建了处理流程,利用分布式计算实现高效大规模数据处理。

在监管报告方面,他们将 Iceberg 与 Apache Impala 结合,作为交互式查询引擎,支持快速、可靠的 PB 级数据集访问。虽然 Impala 负责报告查询,Iceberg 在幕后发挥了关键作用——其对 ACID 事务的支持(原子性、一致性、隔离性和耐久性——确保数据库事务的可靠和一致处理)、灵活的模式演化能力以及丰富的元数据,使报告工作流程即使在数据变化时依然保持一致。

通过与 Cloudera Shared Data Experience(SDX)集成,团队还实现了基于角色和属性的访问控制,实现了细致治理,确保合适的人能够访问正确的数据。这一基础使企业能够及时交付可审计的报告,同时满足日益增长的监管要求。

通过数据驱动的效率实现电信转型

通过与 Cloudera合作, Vodafone Idea 保持了灵活性,加强了治理,并加快了大规模的洞察交付——而无需重建整个数据栈。通过使用 Spark 进行摄取,使用 Iceberg 进行统一表管理,使用 Impala 进行报告,他们在现代化基础设施的同时重用了现有的逻辑和工作流。

这一架构共同带来了可衡量的结果:

  • 查询时间减少了 80%。
  • 通过 Spark 的大规模弹性和 Iceberg 的强大表管理功能,减少管道故障。
  • 改进的监管报告(更快、更可靠)


一家制药公司如何通过整合实现规模化:一套技术栈,10,000 个就业岗位

一家管理 PB 级临床研究数据的全球制药公司面临一个熟悉但日益增长的挑战:他们拥有过多工具,导致数据可靠性问题和合规标准难以达标,同时还面临支持更快人工智能和分析的压力。数据工程团队需要每天运行超过 10,000 个 ETL 作业,但缺乏标准化的方式来构建、管理或验证跨团队的管道。

借助 Cloudera on AWS ,该公司明确了未来的发展方向。团队在 Cloudera 数据工程上使用 Spark 标准化了所有数据管道,统一并扩展了批处理、流式和机器学习工作负载的处理。同时,他们采用 Iceberg 作为默认的开放表格式,以确保模式演进的一致性、内置版本控制以及跨团队和环境的企业级治理。

通过在 Cloudera 上采用 Spark 和 Iceberg,公司奠定了一个干净、可扩展的数据运营基础,标准化了数据管道,实现了团队和工具间的安全数据共享,并为更快、更先进的人工智能和分析铺平了道路。该基金会现支持从监管审计工作流程到加速临床试验发现和药物开发的人工智能模型,确保公司未来能够无缝整合任何新技术或引擎。

利用统一数据平台变革制药行业

在 Cloudera 平台上实现标准化,为这家全球制药公司带来了新的运营一致性水平:

  • 无中断的治理:Iceberg 的写入-审计-发布模式允许上游团队在发布到生产环境前验证数据——同时不破坏下游工作流程。
  • 时间旅行以实现可追溯性:监管团队可以立即访问历史数据快照,实现无缝回滚和审计支持。
  • 共享管道逻辑:作为统一引擎,从数据工程师到数据科学家等团队可以轻松协作,并在不同作业和环境中重用核心转换,减少重复,简化维护。


构建数据工程和人工智能的现代基础

这两个故事有一个共同点:两家组织都面临着数据工作流程的碎片化、规模压力以及日益复杂化的问题。通过将 Apache Spark 和 Apache Iceberg 与 Cloudera 标准化,他们围绕开放、可扩展且可信的组件重构了管道——实现了更好的治理、更快的性能以及更清晰的数据流,惠及人工智能和分析。

借助 Cloudera 数据工程,企业可以获得可在混合和多云环境中运行的端到端解决方案。它将 Spark、Iceberg 和 Airflow 集成编排功能结合起来,使团队能够:

  • 只需构建一次管道,即可在任何地方运行——无论是在数据中心还是云端
  • 开放数据湖仓中大规模维护信任和治理

观看此交互式演示,了解 Spark 和 Iceberg 如何在 Cloudera 上为可信、可扩展的管道提供支持。亲自试看 Cloudera 数据工程 5 天试用版,立即开始构建 AI 就绪的数据工作流程。

准备好了吗?

Your form submission has failed.

This may have been caused by one of the following:

  • Your request timed out
  • A plugin/browser extension blocked the submission. If you have an ad blocking plugin please disable it and close this message to reload the page.