满足每一种业务需求的实时数据 API

通过强大的 API 获取来自 120+ 域名的结构化、可筛选的实时数据。使用 AI 筛选数据集,自动化数据交付,并无缝集成到你的工作流中。

网页抓取工具 - 网页爬虫工具
  • AI 驱动的筛选
    支持自然语言
  • 通过 API 实时交付数据
  • 只为你需要的数据付费
  • 7+ 种语言的可直接使用代码示例
值得信赖 全球 超50000 位客户

AI 驱动

一句提示词筛选海量数据集

用通俗英文准确描述你的需求,让 AI 自动应用最合适的筛选条件。只取回相关数据,从而降低成本。

  • 自然语言筛选——无需写代码
  • AI 自动应用精准筛选条件
  • 将数十亿条记录收窄到真正重要的部分
  • 支持按任意字段筛选:位置、行业、职位、日期
  • 以 JSON、CSV 或 Parquet 导出筛选后的数据
数据 API 库

面向各行业的实时数据 API

通过强大的筛选 API 获取来自 120+ 域名的结构化、已验证数据。只获取你需要的数据,并以实时方式交付到你的应用中。

  • 120+ 个域名
  • 190+ 个数据集 API
  • 数十亿条记录

数据源定价

刷新频率
100K
500K
1M
5M
20M
完整数据集
3TB
  • 干净且已验证
  • 每月更新
  • JSON/CSV/Parquet

灵活交付,贴合你的工作流

通过 API 响应、Webhook、S3、Snowflake、Azure 或直接下载接收筛选后的数据

                              curl --request POST 
--url https://api.brightdata.com/datasets/filter 
--header 'Authorization: Bearer ' 
--header 'Content-Type: application/json' 
--data '{
  "dataset_id": "gd_l1viktl72bvl7bjuj0",
  "records_limit": 100,
  "filter": {
    "name": "job_title",
    "operator": "=",
    "value": "Software Engineer"
  }
}'
                              
                            
                              import requests

url = "https://api.brightdata.com/datasets/filter"
headers = {"Authorization": "Bearer "}
payload = {
    "dataset_id": "gd_l1viktl72bvl7bjuj0",
    "records_limit": 100,
    "filter": {
        "name": "job_title",
        "operator": "=",
        "value": "Software Engineer"
    }
}

response = requests.post(url, json=payload, headers=headers)
print(response.json())
                              
                            
                              const url = 'https://api.brightdata.com/datasets/filter';
const options = {
  method: 'POST',
  headers: {
    'Authorization': 'Bearer ',
    'Content-Type': 'application/json'
  },
  body: JSON.stringify({
    dataset_id: 'gd_l1viktl72bvl7bjuj0',
    records_limit: 100,
    filter: {
      name: 'job_title',
      operator: '=',
      value: 'Software Engineer'
    }
  })
};

try {
  const response = await fetch(url, options);
  const data = await response.json();
  console.log(data);
} catch (error) {
  console.error(error);
}
                              
                            
                              HttpResponse response = Unirest.post("https://api.brightdata.com/datasets/filter")
  .header("Authorization", "Bearer ")
  .header("Content-Type", "application/json")
  .body("{"dataset_id":"gd_l1viktl72bvl7bjuj0","records_limit":100,"filter":{"name":"job_title","operator":"=","value":"Software Engineer"}}")
  .asString();
                              
                            
代码示例

通过简单的 API 调用筛选并获取数据

为什么选择数据源 API?

用于规模化访问、筛选与交付网页数据的一体化解决方案

AI 驱动的筛选

使用简单的 JSON 运算符构建精确筛选条件,无需复杂的爬虫工具逻辑。

实时 API 访问

通过 RESTful API 将筛选后的数据直接返回到你的应用中,响应速度快。

结构化且干净的数据

预先验证并去重,schema 一致,可立即用于你的应用。

灵活的交付方式

支持通过 API、Webhook、S3、Snowflake 或直接下载,以 JSON、CSV 或 Parquet 格式获取。

对开发者友好

完整 API 文档,并提供 Python、Node.js、cURL、PHP、Go、Java 和 Ruby 的代码示例。

只为使用部分付费

将数十亿条记录筛选到你真正需要的数据;无需为无关数据买单。

定价优势

通过策略性降本最大化价值

按记录付费

只为你实际获取的记录付费。将数十亿条筛选到几千条——只为使用部分买单。

智能数据更新

仅订阅“新增记录”或“更新记录”——避免重复下载未变化的数据。

量级折扣

大规模访问数据时,可在高请求量与订阅中享受显著节省。

API 效率

直接获取预筛选数据——无需在本地下载并处理超大文件。

探索数据 API 如何为你所用

用定向数据驱动你的销售漏斗

按职位、公司、地点与技能筛选 LinkedIn 资料。构建精准潜客名单并自动化线索评分。

内容战略

用实时竞品洞察保持领先

监控竞品定价,跟踪新品发布,并在电商与社交平台上分析评价与情绪。

用高质量结构化数据为模型供给

访问数百万条文本、图片与结构化数据记录,用于训练 AI 模型、支持 LLM,并构建智能应用。

做出数据驱动的投资决策

跟踪公司增长指标、融资轮次、管理层变动与市场信号,以识别投资机会。

用市场数据发现房产机会

跨多个市场监控房源、价格趋势、租金水平与房产特征,以识别机会。

准备使用数据 API 为你的业务赋能?

访问 190+ 个实时数据 API,支持 AI 驱动筛选与灵活交付

数据源 API 常见问题

数据源 API 是一组 RESTful API,可让你筛选数据集并创建仅包含所需数据的快照(snapshot)。Filter Dataset API 端点会启动一个异步任务,对你选定的数据集按条件筛选并生成快照,然后你可以下载该快照或通过程序方式访问。

当你调用 Filter Dataset API 时,它会创建一个异步任务来应用你的筛选条件并生成快照。该流程最长超时为 5 分钟。完成后,你会收到一个 snapshot_id,可用于访问筛选后的数据。费用仅按快照大小计费,并基于记录单价计算。

API 支持多种运算符:=(等于)、!=(不等于)、< 与 >(小于/大于)、<= 与 >=(小于等于/大于等于)、'in' 与 'not_in'(值匹配)、'includes' 与 'not_includes'(子串/数组包含)、'array_includes' 与 'not_array_includes'(精确数组匹配),以及用于检查空值的 'is_null' / 'is_not_null'。不同字段类型(文本、数字、日期、数组)适用的运算符不同。

可以。你可以在筛选组中使用 'and' 或 'or' 逻辑运算符组合多个筛选条件。API 支持最大 3 层嵌套深度。对于对象数组,你可以使用 'combine_nested_fields' 参数,确保所有筛选条件在同一个对象内匹配,而不是跨整个数组匹配。

API 支持两种模式:用于常规筛选的 JSON Mode,以及用于上传包含筛选值的 CSV 或 JSON 文件的 Multipart/Form-Data Mode。在 Multipart 模式下,将 dataset_id 和 records_limit 作为 query 参数发送,并在 form-data body 中包含筛选定义与文件。这非常适合按数百或数千个值进行筛选。

你只需要两项内容:数据集 ID(可在数据集详情页找到)以及 Bright Data API key。在 Authorization header 中以 Bearer token 方式携带 API key。数据集筛选不需要代理 zone、密码或其他额外凭证。

筛选后的快照支持 JSON、NDJSON、CSV 与 Parquet 格式。你可以在下载快照或配置交付方式时指定偏好的格式。

当 API 返回 snapshot_id 后,你可以通过直接下载、API 响应、Webhook 回调、Amazon S3、Google Cloud Storage、Snowflake、Azure、SFTP 或邮件来获取筛选后的数据。请选择最适合你工作流的交付方式。

API 会返回 422 错误,并提示 'Provided filter did not match any records.'。请检查筛选语法与取值,确保它们能匹配数据集中的数据。你可以先在控制面板中预览数据集字段与示例数据,再进行筛选。

有。每个数据集最多支持 100 个并行任务。如果超过此限制,你会收到 429 错误。请等待现有任务完成再启动新任务,或联系销售以支持需要提升限制的高用量场景。

如果账户余额不足以处理筛选快照,你会收到 402 错误,并提示所需金额。请充值或调整筛选条件以减少记录数量后再重试。

完整代码示例可在 API 文档中查看,涵盖 cURL、Python、JavaScript 与 Java。每个示例都会演示如何鉴权、构建筛选请求以及处理响应。你也可以在控制面板 UI 中应用筛选条件后,点击 “Filter API” 直接生成筛选语法。

今天就开始获取实时数据

通过强大的 API 筛选、获取并集成网页数据