没有企业会故意构建混乱的技术环境。它通常通过收购、团队自行购买工具以及脱节的、往往不完整的云迁移而悄然形成。其结果是“意外混合”架构,一个建立在多年来被动选择而非主动行动之上的 IT 环境,更糟糕的是,没有人真正制定过修复计划。
随着企业人工智能从实验阶段走向生产阶段,意外的混合架构不仅仅是技术上的不便,更是一种战略隐患。为了维护数据主权并避免人工智能成本飙升,企业需要采用混合架构设计。那些主动进行这种转变的企业将释放其数据资产的全部价值。而那些没有这样做的企业则会发现,随着时间的推移和每一项新的人工智能计划,其架构债务都在不断累积。
这正是我最近与 Forrester 副总裁兼首席分析师 Noel Yuhanna 在 Cloudera 网络研讨会“欢迎来到混合架构设计时代”上探讨的主题。
在这篇博客中,我将进一步阐述这次对话,并概述企业如何通过利用统一治理、开放标准以及清晰的人工智能生命周期需求图谱来创建混合架构设计。
除了并购活动、各自为政的工具采用以及业务部门锁定特定供应商等因素外,过去几十年间向云端的快速迁移也是主要原因之一。许多组织快速且广泛地进行了迁移,而现在风向正在转变。回迁已成为一个真实存在且日益受到关注的话题。
数据说明了一切:据 CIO 报告,将工作负载迁回本地的计划已从 2020 年的 43% 上升至 2024 年的 83%。这并非是对云技术的否定,而是基于成熟认知的判断——即并非所有工作负载都适合部署在云端。事实上,正如 Yuhanna 所指出的,如今银行业和医疗保健行业中约 80% 的交易处理任务仍在本地环境中运行。早期“云成本低”的误解,现已让位于对架构优化、过度预配以及出口流量成本的严峻质疑,而这些问题正在削弱其价值主张。
合规性正迫使企业对过去进展缓慢的 IT 问题采取即时行动。《通用数据保护条例》(GDPR)、《欧盟数据法案》》(EU Data Act)和《健康保险流通与责任法案》(HIPAA)等法规都对数据主权提出了严格要求。与此同时,允许美国当局在全球范围内访问数据的《美国云法案》(US CLOUD Act) 正与欧盟和亚太地区的隐私法规发生冲突,从而积极推动企业转向非美国本土的、具备主权特性的云服务提供商。在金融领域,《数字运营弹性法案》(DORA)强制要求制定供应商退出策略,因为过度依赖单一云服务商已被视为一种系统性风险。
随着新的 AI 法规要求严格的可追溯性,这种压力在 2026 年及以后只会进一步加剧。数据治理与 AI 治理正逐渐融合为一个巨大的合规挑战;缺乏合适架构的企业将面临痛苦且昂贵的改造。
企业级 AI 将长期存在的基础设施问题转化为了紧迫的难题。AI 生命周期在每个阶段的需求截然不同:训练和上下文化需要突发性的大规模计算,这可能使其更适合云端,而稳态推理在本地部署中通常更具成本效益。“有意的混合”意味着将每个阶段映射到真正适合它的基础设施,而不是默认选择单一环境并承担相应的代价。
数据引力使这一问题变得更加复杂。人工智能需要海量的分布式数据,而在不同环境之间移动这些数据会带来实际的延迟和出口成本。您被迫陷入两难境地:要么将模型限制在有限的数据集中(牺牲质量),要么承担巨额费用将数据集中起来(破坏商业案例)。
智能体 AI 使这一挑战变得更加严峻。由于这些系统需要实时、可信的数据来采取行动,存在批处理延迟的管道将无法生存。正如 Yuhanna 所指出的,智能体 AI 的采用率目前约为 24%,预计到 2026 年底将翻一番。那些今天就为这一未来现实构建主动式架构的组织,将在明天获得相应的价值回报。
供应商锁定不仅仅是一个理论上的风险;它在基础设施和软件层面都意味着切实的成本。当您的专有数据工具只能在特定云上运行时,您将面临不断加剧的“双重锁定”。这会将所有主动权都交给供应商,一旦工作负载需要迁移,就会形成严重瓶颈;无论您是要将已完成的云试点转移到数据中心的闲置容量上运行,还是要迁移到新的主权云以满足合规要求。企业可通过工作负载可移植性和开放标准重新获得这种主动权。
两大关键标准使这一切成为可能:
Kubernetes 充当了底层基础设施的通用抽象层。无论底层采用何种硬件或云服务商,它都能提供一致的云原生运营模式,从而消除了“平台迁移成本”——即工作负载每次跨越基础设施边界时所累积的重新开发和调整开销。
Apache Iceberg 在数据层发挥着类似的作用。它不仅仅是对数据存储位置进行抽象,更重要的是扩展了数据的访问范围。开放式表格式和 Iceberg REST Catalog 允许组织与任何第三方系统进行原地共享数据。这意味着您可以将受管控的数据保留在原处,同时允许外部分析平台直接对其进行查询。通过将数据与特定供应商的计算引擎彻底解耦,企业在运行 AI 的方式和位置上获得了真正且面向未来的灵活性。
不妨思考一下,实际应用中的“规模”究竟是什么样子。Yuhanna 最近遇到了一位客户,其业务涉及连接分布在 1,000 个不同源系统中的 50,000 个数据库。达到这种规模时,复杂性并非线性增长,而是呈指数级累积。开放标准并非可有可无;它们是企业保持对自身环境控制权的方式。
碎片化的基础设施必然导致碎片化的治理。正如 Yuhanna 所强调的,大约 70% 的企业数据缺乏适当的元数据和编目;这意味着,只有 25% 的数据被实际用于分析,而大多数企业数据完全处于闲置状态!2006 年,英国数学家兼数据科学先驱 Clive Humby 提出了著名的“数据是新石油”的观点,并指出原始数据必须通过人工智能和分析进行提炼,才能转化为真正的价值。既然每一份数据都蕴含着潜在的洞察,为何还要容忍那种阻碍您充分利用所有数据的架构呢?
安全影响同样不容忽视。根据 IBM 的《2025 年数据泄露报告》,涉及多环境的泄露事件平均损失超过 500 万美元(远高于 444 万美元的全球平均水平),且此类事件目前约占所有泄露事件的 30%。原因很简单:泄露往往发生在集成点,而每一个环境边界都是一个集成点。
解决方案在于建立统一的策略层:即一个涵盖数据分类、访问控制、血缘分析、审计及合规性的单一联合控制平面。在这种模式下,策略将伴随数据而行,并在整个生态系统中实现一致且实时的应用。
受生产环境 AI 实际需求、日益严格的数据主权要求以及对基础设施实际成本的关注加深等因素驱动,企业需要从“偶然混合架构”转向“设计混合架构”。以下是具体实施步骤:
明确目标。在涉足任何技术之前,应制定一份为期 18 个月的路线图,并以具体的业务成果(如收入增长、成本优化或韧性目标)为导向。
开展数据引力评估。梳理数据实际存储的位置及访问者,并评估延迟与数据流出风险。这能有效识别被遗忘的工作负载、重复数据以及合规性盲点。
实施有针对性的合理化整合。精简功能重叠的工具,整合供应商关系,统一治理标准,并构建支持工作负载迁移的架构。
要了解更多信息,请回看我与 Noel Yuhanna 的对话,并通过《从混乱到掌控:为何“设计即混合”是企业数据战略的未来》行业趋势报告进行深入了解。
This may have been caused by one of the following: