网页搜索与阅读
八千代有三个面向网页的工具,各司其职:
webSearch—— 执行查询,返回统一格式的自然搜索结果。webRead—— 抓取 URL,返回可读内容。useBrowser—— 驱动真实浏览器,处理登录、重 JavaScript 应用和多步流程。
搜索设置用于管理隐藏浏览器会话和可选的 Exa 接入。
自动选择搜索供应商
Section titled “自动选择搜索供应商”| 供应商 | 工作方式 | 需要什么 |
|---|---|---|
| Bing(浏览器) | 通过隐藏浏览器会话查询 Bing | 无 |
| Google(浏览器) | 通过隐藏浏览器会话查询 Google | 无 |
| Brave(浏览器) | 通过隐藏浏览器会话查询 Brave | 无 |
| DuckDuckGo(浏览器) | 通过隐藏浏览器查询 DuckDuckGo | 无 |
| Exa | 使用 Exa API | API key |
你不需要手动选择供应商。八千代会根据近期健康情况、延迟、当前负载和闲置时间评分,先调用当下最合适的候选。如果它超时、加载失败、无法提取结果或遇到机器人校验,同一次搜索会自动切换到其他供应商。失败的供应商会暂时冷却,之后再重新参与选择。
四个浏览器供应商无需账号或 API key。配置 Exa API key 后,Exa 会自动加入候选池。
隐藏浏览器会话
Section titled “隐藏浏览器会话”浏览器供应商共用一个独立会话,和你平时的浏览分开。全新的会话没有 Cookie,搜索站点更容易显示同意页或机器人校验。
在 设置 → 来源 → 搜索 → 浏览器会话 → 从 Chrome 导入 中导入一次即可。选一个 Chrome 配置文件后,八千代会把 Cookie 和同意状态复制进搜索会话。面板会显示上次导入时间和来源配置文件。
如果浏览器供应商开始频繁遇到同意页或校验,重新导入一次。
webRead 抓取 URL,并按请求的格式返回可读部分:
| 响应 | 行为 |
|---|---|
| HTML | 用 Defuddle 提取正文 |
| 自动提取文本 | |
| 纯文本、JSON、其他非 HTML | 原样返回 |
| 提取失败的 HTML | 回落到原始响应体 |
如果内容太大,八千代会把它写入工作区文件,再从文件读取,避免占满上下文窗口。
webRead 适合静态抓取。登录流程、JavaScript 应用和需要交互的页面由 useBrowser 处理;内置的 yachiyo-browser 技能包含对应流程。
Exa 通过 API 搜索,不依赖浏览器页面,通常更稳定。你可以在 设置 → 来源 → 搜索 中填写 key,或运行:
yachiyo config set webSearch.exa.apiKey '"your-exa-api-key"'key 生效后,Exa 会自动参与搜索选择。自建或代理端点可以通过 webSearch.exa.baseUrl 指定。