AI

使用 Bright Data 的 Web MCP 增强 Databricks Agent Bricks

了解 Bright Data 的 Web MCP 集成如何为 Databricks AI 代理提供实时网页数据访问能力,从而实现更智能、更有依据的工作流。
3 分钟阅读
搭配 Bright Data 的 Databricks Agent Bricks

在这篇博客文章中,你将了解:

  • Databricks Agent Bricks 是什么,以及它为 AI 代理开发带来的价值。
  • 为什么当 Databricks AI 代理能够将内部业务数据与外部网页情报结合时,会变得更强大。
  • 如何通过将 Agent Bricks 中的 AI 代理连接到 Bright Data 的 Web MCP,为其配备这些能力。

让我们开始吧!

什么是 Databricks Agent Bricks?

Databricks Agent Bricks

Agent Bricks 是一项 Databricks 服务,用于构建、部署和治理以你公司数据为基础的生产级 AI 代理。通过结合企业上下文、AI 模型和外部工具,它让组织能够创建可靠、可扩展且可治理的 AI 代理。

它特别适用于文档分析、客户支持、研究、工作流自动化和商业智能等场景。它提供的主要功能包括:

  • 具备企业感知的 AI 代理:使用业务架构、定义和语义上下文来生成更准确、更有依据的响应。
  • 多种代理类型:支持知识助手、信息抽取流水线、用于多步骤工作流的监督代理,以及完全自定义的 Python 代理。
  • 多模型支持:通过单一平台访问来自 OpenAI、Anthropic、Google、Meta 以及开源提供商的模型,并支持模型切换与回退逻辑。
  • 外部集成:连接到 MCP 服务器、API 和企业系统,将代理能力扩展到内部数据之外。
  • 治理与安全:与 Unity Catalog 集成以强制执行权限、血缘、所有权以及细粒度访问控制。
  • 评估与可观测性:包括自动化基准测试、LLM-as-a-judge 评估,以及用于调试与监控的 MLflow 追踪

为什么 Databricks AI 代理需要访问 Web

无论你使用哪个平台来构建它们,企业 AI 代理的能力取决于它们能够访问的工具。这是因为所有 LLM 都有两个核心限制:

  • 知识有限LLM 在静态数据集上训练,这些数据只代表过去的一个快照。
  • 无法原生访问外部系统:默认情况下,LLM 无法与 Web 或你技术栈中的其他服务交互。

通过为 AI 代理配备工具(通常通过 MCP 或自定义集成)可以解决这一差距。以下是 Databricks Agent Bricks 支持 MCP 的原因。

要解决这两个限制,你需要一个 MCP,使 AI 代理能够搜索 Web、发现相关信息,并从网站提取内容。这正是 Bright Data 的 Web MCP 所提供的。

Bright Data Web MCP 作为解决方案

Bright Data Web MCP 暴露了连接到 Bright Data 的 API 的工具。它是 Databricks 官方支持的集成之一,这意味着你甚至可以直接在 Databricks Marketplace 中 找到它:

Databricks Marketplace 中的 Bright Data Web MCP

在免费的 Rapid 模式层级(包含 每月 5,000 次免费请求)中,Web MCP 可用工具包括:

Tool Description
search_engine + batch version 从 Google、Bing、Yandex 等获取结构化的搜索引擎结果,并以 JSON 或 Markdown 返回
scrape_as_markdown + batch version 在绕过反机器人保护的同时,将任意网页转换为干净的 Markdown
discover AI 驱动的网页发现,返回排序后的相关结果

[专业模式](https://github.com/bright-cn/brightdata-mcp?tab=readme-ov-file#-pricing, modes) 解锁了面向 Amazon、LinkedIn、Yahoo Finance、YouTube、Zillow、Google Maps 等 40 多个来源的平台高级结构化提取能力。它还包含用于浏览器自动化的工具。了解 所有 Web MCP 工具

Bright Data 的突出之处在于其企业级基础设施,由一个 超过 4 亿住宅 IP 的代理网络 支持。这在实现无限可扩展性与并发的同时,达成 99.95% 的成功率,并提供 SLA 支持的 99.99% 在线率。

如何将 Databricks Agent Bricks 连接到 Bright Data 的 Web MCP

在这个分步章节中,你将被引导完成在 Databricks 中配置 Web MCP 的过程。然后,你将学习如何将其集成到 Agent Bricks 中的 Databricks AI 代理里,以启用网页搜索、发现以及抓取能力。

注意:如果你在寻找如何在 Databricks 中访问和查询 Bright Data 数据集,请改为阅读我们的专门博客文章:/blog/web-data/datasets-via-databricks

请按照以下说明操作!

前置条件

要完成本教程部分,请确保你具备:

为了获得更顺畅的体验,也建议你具备:

第 1 步:安装 Bright Data Web MCP

登录 你的 Databricks 账户。你应该会看到主页工作区控制面板:

Databricks 主页工作区控制面板

请记住,Bright Data Web MCP 是 Databricks Marketplace 中官方支持的集成。通过左侧边栏选择 “Marketplace” 选项,然后点击 “View MCP listings”:

点击 “View MCP listings” 按钮

你将被重定向到 Databricks Marketplace。在搜索栏中输入 “bright data”,并选择 “The web MCP” 列表项:

选择 “The web MCP” 卡片

Bright Data “The web MCP” 页面 上,查看详情并点击 “Install” 将其添加到你的工作区:

在你的 Databricks 工作区中安装 Web MCP

请确保在安装表单中填写以下信息:

  • Connection name: bright-data-web-mcp(或你偏好的名称)
  • Host: https://mcp.brightdata.com重要:检查建议的 URL 是否与此一致)
  • Base path: /mcp
  • Bearer token: 粘贴你的 Bright Data API key
  • Credential type: Bearer token
  • Port: 433
填写 ‘Install “The web MCP”’ 表单

最后,点击 “Install” 通过官方集成将 Bright Data Web MCP 添加到你的 Databricks 工作区。太棒了!

第 2 步:允许连接到 Bright Data 服务器

安装后,你将被重定向到 bright-data-web-mcp 页面。不过,你可能会注意到为已配置的 MCP 服务器未检测到任何工具:

注意未找到任何工具

这是因为 Databricks 默认会阻止到外部域的出站连接,包括 mcp.brightdata.com(Web MCP 服务器所必需)。

作为参考,其底层技术错误为:

"Failed request to https://mcp.bringthdata.com:443/mcp. Error: Access to mcp.bringthdata.com is denied because of serverless network policy."

要修复该问题,你必须在 Databricks 账户设置中明确允许无服务器出站流量访问 mcp.brightdata.com。首先打开右上角的工作区下拉菜单并选择 “Manage account”:

选择 “Manage account” 选项

进入 “Security” 部分,选择 “Serverless egress control”,并点击 “Create new network policy”:

点击 “Create new network” policy

为该策略命名(例如 bright-data-mcp),并选择 “Restricted access to specific destinations” 选项。然后使用 “Add destination” 按钮将 mcp.brightdata.com 添加为允许的目标:

将 “mcp.brightdata.com” 配置为已批准的域

为所有 Databricks 无服务器产品启用该策略并点击 “Create”:

创建新的网络策略

接下来,前往 Workspaces 页面,选择你的工作区,并点击 “Networking” 下拉部分中的编辑图标。将网络策略设置为 bright-data-mcp,然后点击 “Save”:

在你的 Databrocks 工作区中设置所需的网络策略

返回 bright-data-web-mcp 页面并刷新。现在你应该会看到 Databricks 成功加载 Web MCP 工具:

注意已加载的工具

这些工具对应于 Rapid(免费)模式下的 Web MCP 所暴露的能力。做得好!

第 3 步:验证 Web MCP 连接可用

bright-data-web-mcp page 上,点击 “Try in Playground”。这将打开一个已配置 MCP 服务器的 AI 聊天界面。

提出一个简单的问题,例如:

Scrape the https://example.com page as Markwon

你应该会看到 AI 自主调用 Web MCP 工具 scrape_as_markdown 对指定 URL 执行操作以完成任务:

注意使用了 “scrape_as_markdown” 工具

返回的 Markdown(通过由 Bright Data 的 网络解锁器 API 支持的 scrape_as_markdown 工具检索)与目标页面上可见的内容一致:

example.com 页面

这确认了 AI 正在正确使用 Web MCP 工具,并且集成按预期工作。完美!

第 4 步:定义你的 Databricks AI 代理

要访问 Databricks Agent Bricks 服务,请点击左侧边栏中的 “Agents”。然后,点击 “Create Agent” 添加一个新的 AI 代理:

点击 “Create Agent” 按钮

系统会要求你选择要创建的代理类型。对于本教程,请选择 “Supervisor Agent”:

选择 “Supervisor Agent” 选项

监督代理 是一个多代理编排系统,用于协调 AI 代理与工具以解决更复杂的任务。

要连接 Bright Data Web MCP,请在 “Tools and subagents” 部分下点击 “Add an External MCP”:

点击 “Add an External MCP” 按钮

接下来,选择你之前配置的 bright-data-web-mcp 连接:

选择 “bright-data-web-mcp” 连接

你的代理现在将可以访问 Bright Data Web MCP 工具。你可以重复相同过程来添加额外工具、MCP 服务器、Genie Spaces 或其他集成。

在此示例中,该代理还连接到了 “Bakehouse Sales Starter Space”,这是一个内置的 Genie Space,链接到示例 samples.bakehouse Delta 数据集。

已配置的 Databricks AI 代理

重要:在生产环境中,将代理设置为使用连接到你自己 Databricks 数据集的自定义 Genie Spaces。你还应自定义代理名称、说明和描述,以更好地匹配你的具体用例。

很好!唯一剩下的步骤就是测试由 Web MCP 驱动的 Databricks AI 代理。

第 5 步:测试代理

要验证你的 Databricks AI 代理是否正常工作,请尝试一个将内部业务数据与外部网页情报结合的任务。例如,输入:

Retrieve our revenue for May 2024. Then search online for bakery industry revenue data for the same period. Scrape the most relevant sources and produce a report highlighting both internal revenue performance and external market insights, including trends, expectations, and overall industry conditions.

运行该提示词后,你应该会看到类似如下内容:

提示词执行

具体来说,该 Databricks AI 代理:

  1. 查询了 “Bakehouse Sales Starter Space”,以检索所请求时间段的营收数据。
  2. 调用了 Bright Data Web MCP 的 search_engine 工具(由 Bright Data 的 搜索引擎 API 驱动),从 Google 收集关于烘焙行业表现的相关搜索结果。
  3. 从返回的结果中识别出最相关的来源。
  4. 使用 scrape_as_markdown 工具从这些页面提取内容。
  5. 将外部洞察与内部业务数据结合,生成一份统一报告。
生成的报告

请注意,最终输出将专有业务信息与最新的市场情报融合在一起。没有 Web MCP,这是不可能的,因为 LLM 没有原生的 Web 访问能力。

Web MCP 弥补了这一差距,使你的 Databricks AI 代理能够搜索 Web、发现相关来源,并从网站提取信息,包括复杂或受保护的页面。所有这些都运行在为可扩展性与并发而构建的 Bright Data 企业级基础设施 上。

Et voilà!这个示例只是展示了你可以构建内容的冰山一角。通过将 Databricks AI 代理与 Bright Data Web MCP 结合,你可以创建更高级的工作流,将内部分析与实时网页数据集成,用于 广泛的用例

结论

在本教程中,你了解了 Databricks Agent Bricks 是什么以及它支持的功能。尤其是,你看到了如何构建一个 Databricks AI 代理,并将其连接到 Bright Data Web MCP

借助此集成,Databricks AI 代理获得了用于研究、事实依据补全、数据丰富以及许多其他任务的 Web 访问能力。这帮助你将内部 Databricks 数据与企业级外部情报结合起来,为更深入、更丰富的分析打开大门。

对于更高级的场景,请探索完整的 为 AI 生态系统构建的 Bright Data 解决方案

立即创建一个 Bright Data 账户,并开始使用面向 AI 的网页数据工具进行构建!

支持支付宝等多种支付方式

Antonello Zanini

技术写作

5.5 years experience

Antonello是一名软件工程师,但他更喜欢称自己为技术传教士。通过写作传播知识是他的使命。

Expertise
Web 开发 网页抓取 AI 集成