湖仓架构的开发旨在将数据湖的非结构化规模与数据仓库的结构化性能相结合。这一转变统一了企业数据,并提供了第一个真正的“单一数据源”。但到了 2026 年,其使命已扩展。随着我们进入智能体人工智能时代,湖仓正在从用于支持决策的回顾性报告存储库,演变为一个高性能的上下文层,为自主企业代理提供支持,从而实现自主和即时行动。其开放、灵活且可靠的基础架构,通过互操作性、实时数据处理、安全性、治理、跨云和本地可移植性以及内置的 AI 自动化功能,增强了所有管理和运营功能。
在 Cloudera,我们看到财富 2000 强企业领导者对其数据资产的看法正在发生根本性的转变。压力来自于他们需要高效地为自主 AI 代理提供数据。他们正在使用 Cloudera Lakehouse 来统一结构化、半结构化和非结构化数据,从而实现“零复制”、“零 ETL”、近实时模型微调和实时推理。湖仓支持 RAG 管道、AI 特征存储和实时流管道,为企业代理提供治理框架、语义上下文层和运营智能。
在 AI 时代,您的数据就是您最大的护城河。因此,理应由您的数据战略来决定您使用的工具以及人工智能的训练和运行环境,而不是反过来。然而,许多供应商仍然推行“整合优先”模式,要求您先将数据迁移或复制到他们专有的治理或云环境中才能使用。这不仅会增加数据战略的成本、复杂性和风险,而且通常还会迫使您放弃数据的所有权和控制权。
您的数据湖仓必须具备开放性、灵活性、可移植性、互操作性和适应性,以便在您的数据战略发生变化时,您的数据湖仓也能随之调整。因此,开放表格式(Apache Iceberg)、开放目录(Apache Polaris)、开放查询引擎、REST API 和联合访问正在成为新的基准,并构成 Cloudera 湖仓的核心构建模块。
LLM 在互联网上进行训练。它们并不了解您的业务。人工智能的成功不再取决于模型质量。它取决于您要自动化的工作流程以及您为模型提供的业务上下文的准确性——例如 ERP 记录、财务交易、供应链日志等。
Cloudera 数据湖仓为您的代理提供了一个安全可靠、具有上下文感知能力的层:
360 度上下文:通过单一治理层统一并提供来自边缘、数据中心和云端的数据,从而提供完整的 360 度上下文。
多模态数据:转换、清理和统一非结构化数据(例如日志、视频和图像),并与结构化表一起增强分析和推理能力。
共享语义:结合技术、业务和运营元数据,使代理能够轻松地在正确的业务上下文中发现、理解和使用您的数据。
全方位溯源:当人工智能代理做出价值 100 万美元的采购决策时,您需要一份“纸质记录”,或者说可解释性。Cloudera 通过端到端的可追溯性和从边缘传感器到最终模型输出的自动化溯源,提供这种可解释性。
Cloudera 的湖仓可在分布式和异构环境中提供实时上下文信息,使企业能够掌控自身的数据、模型和业务规则,同时为人工智能系统提供完整的上下文信息。
Cloudera 让您能够将分析和 AI 应用于数据本身——无论数据存储在何处。无论您的数据位于本地对象存储、私有云还是多个公有云中,我们的湖仓都能以统一的零拷贝架构提供可移植的 AI。您可以在云端构建,在本地进行推理——无需任何重构成本——从而掌控您的数据并防止知识产权泄露。对于像华侨银行这样的全球金融机构而言,这种架构开放性使其能够在满足严格的区域数据驻留和主权要求的同时,在整个集团范围内扩展 AI/ML 能力。
AI 系统对数据质量、新鲜度和一致性高度敏感。随着数据量和 AI 工作流呈指数级增长,手动优化变得难以为继。Cloudera 将 AI 驱动的自动化功能直接集成到湖仓平台中,用于:
数据访问
数据优化
压缩(Compaction)
模式演化
标签和分类
工作负载调整
质量监控
治理执行
Lineage
生命周期管理
它能够持续进行自我优化,同时降低数据和 AI 团队的运维复杂性。借助 Cloudera Agent Studio,我们的客户可以部署代理,根据业务意图自主监控、转换和移动数据。
“流式”和“批处理”之间的区别正在逐渐消失。为了支持代理工作流,数据不能是几分钟或几小时前的——它必须是连续的。
Cloudera Open Data Lakehouse 作为一个流式湖仓,将每个数据点视为一个事件,使 AI 代理能够在供应链中断或财务异常发生后的毫秒级时间内做出响应。它在事件发生地直接处理这些事件,并在将流数据摄取到湖仓之前对其进行复杂的分析,以进行近乎实时的决策。它还会将预处理后的流数据提供给推理代理,以便进行实时操作。湖仓还包含数据共享和联邦功能,确保能够以最小的延迟处理来自其他来源的数据,而无需进行不必要的数据移动或数据转换。
湖仓并非集中式单体架构。随着物联网、智能工厂和移动应用的普及,边缘推理变得至关重要。Cloudera 将湖仓向外扩展,允许在数据生成的地方(边缘)进行分析和操作,同时将分析结果同步回中央枢纽。在 Navistar:通过实时处理来自数千辆联网卡车的传感器数据,他们通过自动触发主动维护措施,将维护成本降低了 30%。
在 Cloudera,我们看到了湖仓和 Fabric 架构的融合。湖仓统一数据,而 Fabric 则激活元数据(在数据摄取时自动捕获:血缘关系、敏感度标签等)。两者结合,有助于实现数据发现、集成和治理的自动化。这简化了随时随地访问数据的流程,并实现了零复制、零 ETL 和零冗余的安全保障。
第一波 AI 浪潮是关于对话的。下一波浪潮是关于智能体的。这个时代的赢家不会是那些仅仅“存储”最多数据的人;而是那些能够为自主系统提供可信、连续、多模态上下文信息,从而做出清晰建议和决策的人。通过为 AI 智能体提供受控的、联合的数据访问权限,Cloudera 正在帮助全球最大的企业从“聊天”转向“行动”。
无论您的数据位于数据中心、云端还是边缘,Cloudera Open Data Lakehouse 都能作为混合型数据湖仓,确保其为智能体时代做好准备。
观看视频,了解 Cloudera Open Data Lakehouse 的工作原理。
访问 Cloudera Open Data Lakehouse 了解更多信息。
This may have been caused by one of the following: