数据产品只是将数据打包以解决特定业务问题的一种方式。我们不会提供可能杂乱无章或令人困惑的原始数据,而是像对待货架上的商品一样对待数据,提供数据说明、使用方法,并承诺数据的准确性。这会将原始信息转换为整个组织都可以依赖的高质量、可检测到的资产。
想象一下,购买散装食材和购买餐包之间的区别。数据产品就是这个工具包:它将原始数据与解决特定业务问题所需的说明和上下文一起打包。它将分散的数据转化为可信、易于查找且对组织有立竿见影之效的数据。
数据产品能以多种形式使用,包括:
“数据产品”和“数据即产品”这两个术语很容易混淆,但它们的意思不同。了解两者之间的区别对于构建云解决方案至关重要。
主要差异:
特性 | 数据即产品 | 数据产品 |
它是什么? | 策略或理念。 | 预打包的数据资产。 |
主要目标 | 提高数据质量和可信度。 | 解决特定的用户问题。 |
示例 | BigQuery 中有一个干净、有文档记录的“客户”表,并已分配所有者。 | “客户 360”数据产品,可从该表中提取数据以显示用户��历史记录。 |
特性
数据即产品
数据产品
它是什么?
策略或理念。
预打包的数据资产。
主要目标
提高数据质量和可信度。
解决特定的用户问题。
数据产品通过将数据和模型打包成合乎逻辑的、安全的、可检测到的单元,发挥治理能力的作用。这使组织能够通过审批工作流确立明确的所有权和受管理访问权限。
零售商可以将客户行为数据和商品推荐模型打包成一个“个性化数据产品”。通过使用 Knowledge Catalog,组织可以确保只有已获授权的开发者才能访问底层数据集和模型端点。此治理层通过元数据(切面)提供上下文,同时保护敏感的用户互动。
金融机构可以创建“欺诈风险”数据产品,将实时交易流与机器学习模型捆绑在一起。这个统一的软件包可实现安全的审批工作流。当调查员需要访问风险评分时,他们会通过中央门户网站提出请求。这可确保访问权限有时间限制并接受全面审核,从而防止未经授权的数据暴露。
在制造业中,“机器健康”数据产品将传感器数据与异常检测模型相结合。自动数据质量检查和分析等治理功能可确保模型仅使用可信数据。这可以防止因传感器故障或“杂乱”的原始输入而导致错误的故障预测。
物流团队可以将路线规划算法和车辆限制数据集打包为“配送优化”数据产品。通过在数据编织中建立网域级所有权,该公司可以跟踪数据沿袭,准确了解原始位置数据是如何转换为最终司机排班的。
构建数据产品可以为企业带来显著优势。它们可以帮助企业将重点从简单的数据收集转移到实际使用数据来创造价值。
更明智的决策
组织可以使用数据产品,将关键分析洞见直接呈现给需要的人员。这有助于团队根据证据而非直觉做出更明智的战略选择。
更快的创新
可重复使用的数据产品可缩短实现新应用场景所需的时间。开发者可以将现有数据产品集成到应用中,从而更快地发布功能和解决问题,而无需管理复杂的原始数据流水线。
提高收入
数据产品可帮助公司直接通过资产创收。例如,企业可能会将专有数据打包供其他开发者使用。
竞争优势
数据驱动型组织通常在获取和留住客户方面更有效。通过提供更智能、更个性化的体验,公司可以从未能有效利用数据的竞争对手中脱颖而出。
安全构建智能体
通过在这些“预打包”的数据产品之上构建 AI 智能体,您可以确保 AI 从经过验证的高质量信息中学习,而不是从杂乱的原始数据中学习。这会创建一个安全的环境,让 AI 能够提供准确且实际可信的答案,而不会意外泄露敏感信息或错误信息。
我们来看看如何使用 BigQuery 和 Knowledge Catalog 等工具构建“零售库存预测器”之类的数据产品。
目标:构建一个内部工具,告知商店经理哪些商品库存不足,并预测下周需要订购哪些商品。
首先,您需要一个地方来存储销售数据。您可以使用无服务器数据仓库 BigQuery 设置一个流水线,将每天每个商店的销售额流式插入到 BigQuery 表中。
在构建模型之前,您需要确保数据是干净的。使用 Knowledge Catalog 管理数据生命周期,它可以帮助您:
现在,您要创建情报。您无需将数据导出到单独的工具,只需使用 BigQuery ML 编写一个简单的 SQL 查询来训练机器学习模型即可。此模型会分析过去的销售趋势,以预测未来的需求。
最后,您可以使用 Looker 构建一个简单的 API 或信息中心。当商店经理登录时,看到的不是 SQL 查询,而是一个简洁的界面,上面写着“在周二之前再订购 50 件红色衬衫”。恭喜!您已成功将原始数据转化为有用的数据产品。