这篇博客是三篇系列文章的最后一篇:第一篇介绍了高性能计算(HPC)的基础知识,第二篇探讨了主权数据湖仓的重要性。
虽然数据湖仓本身并不支持高性能计算——高性能计算模拟需要截然不同的技术平台——但它是实施以 ROM 为中心的战略的理想补充,可提供关键功能(结构化 MLOps、实验支持、经济高效的数据归档、简化的访问、协作工具链等等)。
Cloudera 独特地弥合了大规模专业物理数据 (HPC) 与现代人工智能训练 (MLOps) 的敏捷需求之间的鸿沟。通过提供与云无关、支持自主架构的架构,Cloudera 确保合规性,并为企业提供安全可行的 ROM 实施路径。
Cloudera 通过以下特定功能支持这种融合:
挑战:如上所述,在传统存储中,存储和管理 PB 级的历史全阶模型 (FOM) 快照通常既昂贵又复杂。然而,工程师还需要一种方法来摄取、转换和归档这些海量数据集,并严格管控数据,同时维护“运营主权”,从而确保数据永远不会离开目标管辖范围。
Cloudera 解决方案:
Cloudera DataFlow:作为通用摄取引擎,Cloudera DataFlow 允许工程师在协作环境中构建无需编写代码的多模态管道。它可以摄取原始求解器文件(CFD/FEA 日志),将非结构化数据转换为结构化特征,并将其直接存储到数据湖仓的对象存储(基于 Apache Ozone 的 Cloudera 对象存储)中,以便在需要训练/重新训练 ROM 时轻松访问。
溯源与审计:至关重要的是,DataFlow 提供内置的数据血缘和审计功能。这确保了用于训练 ROM 的每个“特征”都可以追溯到其原始源文件,从而为安全关键型工程提供所需的审计跟踪。
Cloudera SDX 为所有数据和 AI 服务的授权策略提供统一的策略设计和执行点,从而在确保对 FOM 数据集和 ROM 特征中包含的敏感 IP 的访问受到控制方面,保持单一的管理界面
挑战:开发精确的 ROM 需要数百次迭代。如果没有中央记录系统,研发团队将面临“版本混乱”的困境,难以追踪哪些超参数或数据集产生了最佳结果。
Cloudera 解决方案:
Cloudera AI Workbench:此服务提供了一个协作环境,其中包含安全、开源的 Notebooks-as-a-Service (Jupyter)。为了进一步提升开发者的效率,该工作台提供了灵活的第三方编辑器使用方式,包括 VS Code、PyCharm 和 RStudio,既可以在浏览器中使用,也可以作为连接到工作台计算资源的本地 IDE 使用。此外,该工作台与 MLflow 原生集成,允许用户通过记录超参数、评估指标以及任何团队开发的每个特定 AI 模型版本所使用的训练数据集版本,为每个 ROM 项目创建文档化的“真实数据源”。这有助于提高可见性和可重用性,使不同的团队能够根据各自的专业知识轻松调整模型架构。
挑战:研发团队需要即时访问计算资源,不仅用于迭代训练,还用于生产级 AI 模型推理。由于高容量推理循环,公共云推理服务通常会导致“代币冲击”或成本失控。相反,本地 IT 系统通常缺乏快速配置资源的灵活性。
Cloudera 解决方案:
PaaS-by-Design 架构:Cloudera 基于 Kubernetes 构建,提供了一个现代化的多租户平台,用户可以在该平台上自行配置数据和 AI 服务。无论运行在自有数据中心还是私有云订阅中,该平台都能根据当前的工作负载需求自动扩展。
Cloudera AI 推理服务:该服务尤其允许工程师部署模型的版本化版本,并提供标准的 REST API 以供立即投入生产使用。由于它运行在自托管的基础设施上,因此其计费模式基于计算小时数(每个 GPU/CPU),而不是“每个令牌”。这使得数十个不同的模型可以整合到单个集群中,从而为高容量工程工作负载带来显著的规模经济效益。
挑战:ROM 的最终价值往往体现在数据中心之外——例如嵌入到制造车间或电厂控制器中,用于实时预测性维护。
Cloudera 解决方案:
Cloudera Edge Management: 这项服务允许从业人员构建和部署数据管道,将“进程中”模型推理直接部署到边缘基础设施。借助无需编写代码的可视化界面,工程师可以将训练好的 ROM 推送到远程代理集群,从而在数字孪生和物理资产之间形成闭环。
挑战:工程生命周期以数十年为单位。专有工具或封闭云格式会为长期产品数据带来不可接受的供应商锁定风险。
Cloudera 解决方案:
开源核心:Cloudera 的整个数据和 AI 平台都构建在开放的社区技术之上(例如 Apache NiFi、Apache Spark、Apache Iceberg、Apache Ozone、CNCF Kubernetes 等)。
增强体验:通过将这些标准封装在一个统一、安全且用户友好的控制平面中,Cloudera 弥合了开源的自由度和现代云平台应有的易用性之间的差距。这确保您的关键知识产权始终保持可移植性和可访问性。
与市场上其他竞争性的数据湖仓平台不同——这些平台通常会将专有存储和第三方计算割裂在生命周期中,或者强制用户在公有云和公有云之间做出选择——Cloudera 在一个统一的平台上提供上述所有功能。
Cloudera 将这种现代化的、以 PaaS 为中心的用户体验与独特的灵活性相结合,可将整个平台部署在完全自主的数据中心。这有效地使在受监管市场或战略敏感项目中运营的先进制造客户能够在尽可能安全的环境中执行尖端的 AI 战略,满足数据驻留和运营主权方面的最严格要求。
高性能计算 (HPC) 和企业 AI 的未来是自主的、开放的和运营统一的——而这个未来正是建立在 Cloudera 之上。我们的 Private AI Anywhere 平台可在任何云端和数据中心运行,提供对所有关键任务数据、模型、代理和推理的端到端、可控控制,以确保主权、合规性和经证实的业务价值。
This may have been caused by one of the following: