百度360必应搜狗淘宝本站头条
当前位置:网站首页 > IT知识 > 正文

我用 GPT-4o 试着进行网页抓取,但太贵了!

liuian 2024-12-13 14:53 49 浏览

作者 | Eduardo Blancas
出品 | CSDN(ID:CSDNnews)

一个月前,OpenAI 在其 API 中新增了结构化输出功能,这意味着 OpenAI 现在能够根据开发者提供的 JSON 模式,准确地生成符合要求的输出结果。我看到了这个功能之后,对此非常感兴趣,因此决定试用一下,并开发了一个 AI 辅助网页抓取工具。本文将总结我的学习成果,也希望对大家有所裨益。


要求 GPT-4o 抓取数据

第一个实验是直接要求 GPT-4o 从 HTML 字符串中提取数据,因此我使用了新的结构化输出功能和以下 Pydantic 模型(https://docs.pydantic.dev/latest/):

from typing import List, Dictclass ParsedColumn(BaseModel): name: str values: List[str]class ParsedTable(BaseModel): name: str columns: List[ParsedColumn]

使用的 Prompt 是:

你是一名网络爬虫专家。现在给你一张包含表格的 HTML 内容,你必须从中提取结构化数据。

下面是我在解析不同表格时发现的一些有趣现象。

注:我也试过 GPT-4o mini,但结果明显比 GPT-4o 差,所以我继续使用 GPT-4o 进行实验。


解析复杂表格

在对一些简单的表格进行实验后,我想看看模型在处理更复杂的表格时会有怎样的表现,因此我使用了 Weather.com 提供的 10 天天气预报。该表的顶部有一大行,用来展示当天的天气,其余 9 天所使用行数占得空间较小。有趣的是,GPT-4o 能够正确解析:

对于剩下的 9 天天气预报,表格显示了昼夜预报(见上面的截图)。模型正确解析了这些数据,并添加了日/夜列。下面是它在浏览器中的显示效果(注意,要显示这个效果,我们需要点击每一行右侧的按钮):

起初,我以为我出现了幻觉,因为我在网站上没有看到 “条件”(Condition)一栏,但在查看源代码后,我意识到这些标记是存在的,但在表格中看不到。


合并行会破坏模型

当我思考在哪里可以找到简单的表格时,我首先想到的是维基百科。结果发现,维基百科上的一个简单表格(人类发展指数)破坏了模型,因为它具有重复值的行被合并了:

虽然模型能够检索单个列(按照系统 Prompt),但它们的大小并不相同,因此,我无法将数据表示为表格。

我尝试使用以下方式修改系统 Prompt:

表格可能会将多行折叠成一行。如果是这种情况,请将折叠的行提取为多个 JSON 值,以确保所有列都包含相同数量的行。

但它不起作用。我还没有尝试修改系统 Prompt 来告诉模型提取行而不是列。


要求 GPT-4o 返回 XPaths

每次运行 OpenAI API 调用可能会非常昂贵,因此我认为应该让模型返回 XPaths 而不是解析后的数据。这样我就可以抓取同一页面(例如获取更新后的数据),而无需花费太多。

经过一些调整后,我想出一个 Prompt:

你是一位网络爬虫专家。

用户将提供 HTML 内容和列名。您的任务是想出一个 XPaths,以返回该列的所有元素。

XPaths 应该是一个字符串,可以通过 Selenium 的 driver.find_elements(By.XPATH, xpath) 方法进行评估。

返回完整匹配的元素,而不仅仅是文本。

遗憾的是,这种方法效果不佳。有时,模型会返回无效的 XPaths(尽管使用提到 Selenium 的句子可以缓解这种情况),或者 XPaths 会返回不正确的数据或根本没有数据。


结合两种方法

我的下一个尝试是将两种方法结合起来:一旦模型提取了数据,我们就可以将其作为参考,向模型请求 XPaths。这比直接请求 XPaths 效果好得多!

我注意到有时生成的 XPaths 根本不会返回任何数据,因此我添加了一些愚蠢的重试逻辑:如果 XPaths 没有返回结果,则重试。这对我测试的表格很有效。

然而,我注意到一个新问题:有时第一步(提取数据)会将图像转换为文本(例如,指向上方的箭头可能会在提取的数据中显示为“箭头向上”),这会导致第二步失败,因为它会查找不存在的数据。我没有尝试解决这个问题。


GPT-4o 太昂贵

使用 GPT-4o 进行抓取可能会非常昂贵,因为即使是小型 HTML 表也可能包含大量字符。我已经试验了两天,已经花了 24 美元!

为了降低成本,我添加了一些清理逻辑,在将 HTML 字符串传递给模型之前,删除其中不必要的数据。一个简单的函数可以删除除 class、id 和 data-testid 之外的所有属性(我注意到生成的 XPaths 正在使用这些属性),将表中的字符数减少了一半。

我没有看到任何性能下降,并且我怀疑此举也有助于提高提取质量。

目前,第二步(生成 XPaths)对表中每个列进行一次模型调用,另一个改进可能是生成多个 XPaths,我还没有尝试这种方法并评估性能。


结论和演示

GPT-4o 的抓取质量让我有些吃惊(但当我看到我必须向 OpenAI 支付具体多少钱时,我又觉得心疼)。尽管如此,这是一个有趣的实验,我确实看到了人工智能辅助网页抓取工具的潜力。

我使用 Streamlit 做了一个快速演示,对此感兴趣的小伙伴可以通过下方链接查看:https://orange-resonance-9766.ploomberapp.io,源代码在 GitHub 上:https://github.com/edublancas/posts/tree/main/ai-web-scraping。

我想测试更多的表格,但是,由于这会涉及到更高的 OpenAI 费用,所以我只尝试了其中的少数几个。

原文链接:https://blancas.io/blog/ai-web-scraper/

声明:本文为 CSDN 翻译,未经允许禁止转载。

相关推荐

口碑最好的随身wifi品牌(随身wifi十大排名)

哪个牌子最好用性价比最高一目了然!格行设备价格:69/99/109/139/168(性价比高)芯片:进口马维尔芯片套餐:双网设备,套餐价格一致,随用随充续航:3000毫安18小时左右 33...

新买的台式电脑没声音(新买的台式机没有声音)

解决方法如下:1、查看主板的声卡驱动装没装上。2、驱动装好了,在右下角的小喇叭有没有,如果有,鼠标放在上面,右击就会看到声音的各种设置,如果没看到小喇叭,进入设备管理器看一下声音的硬件上是否有黄色标记...

dlink路由器设置密码步骤(dlink路由器设置教程)
  • dlink路由器设置密码步骤(dlink路由器设置教程)
  • dlink路由器设置密码步骤(dlink路由器设置教程)
  • dlink路由器设置密码步骤(dlink路由器设置教程)
  • dlink路由器设置密码步骤(dlink路由器设置教程)
三星笔记本u盘启动快捷键(三星笔记本u盘启动设置)

开机出现“SAMSUNG”画面时按F2进入BIOS设置,找到【Advanced】选项下,将快速启动“FastBIOSMode”项选为“Off”2.按F10键保存退出并重启,插入U盘,再次按F2键进入B...

普联无线路由器设置(普联路由器上网设置)

关于这个问题,以下是普联无线路由器的设置步骤:1.首先,将您的普联无线路由器与电脑或笔记本电脑连接。2.打开您的浏览器,输入路由器的IP地址(通常为192.168.1.1或192.168...

光盘映像文件怎么打开运行(光盘映像文件是干嘛的)
  • 光盘映像文件怎么打开运行(光盘映像文件是干嘛的)
  • 光盘映像文件怎么打开运行(光盘映像文件是干嘛的)
  • 光盘映像文件怎么打开运行(光盘映像文件是干嘛的)
  • 光盘映像文件怎么打开运行(光盘映像文件是干嘛的)
万兴数据恢复专家免费版(万兴数据恢复专家app)

手机版本目前还在开发当中,目前只有电脑版本跟网页版万兴数据管家,非常靠谱!这是一款专门针对苹果微信数据管理的软件,能够恢复苹果手机聊天记录、聊天记录备份、聊天记录导出!支持微信免费备到本地电脑,包括聊...

笔记本电脑怎么打开摄像头功能

看你的情况是,笔记本自带摄像头吧!如果是的话,只要和别人用通讯工具(支支视频,比如qqskype)聊天时,都可以自动打开!如果想单纯的自拍,打开“我的电脑”认真看,有一个选项(除了硬盘分区、光驱之外)...

w7主题设置(w7怎么换主题)

1、打开win7系统电脑左下角“开始”菜单,找到【控制面板】点击打开;2、进入控制面板界面,右上方【查看方式】更改为“小图标”,然后找到【管理工具】打开;3、进入“管理工具”,点击打开【服务】选项;4...

显卡温度多少正常范围(显卡温度一般在什么范围合理)
显卡温度多少正常范围(显卡温度一般在什么范围合理)

1、正常情况下显卡的温度是在30至85这个区间。2、如果是天气热一点的话,保持在50至85也是属于正常的。3、如果电脑在玩着大型游戏,显卡温度达到90以上都是有可能的。4、但如果你的显卡温度超过95度的话,就要注意一下了,这个时候可以保持室...

2026-01-03 01:55 liuian

惠普1008打印机驱动安装教程

首先,你可以从惠普官网下载最新的驱动程序并解压缩。接下来,双击解压后的驱动文件并跟随提示完成安装。如果你遇到任何问题,可以尝试用管理员权限运行安装程序或尝试重新启动电脑后再次安装驱动。最后,检查设备管...

惠普打印机官方售后维修服务中心

郑州市金水区文化路82硅谷广场B座1303室营业时间:周一至周日9:00-18:00支持品牌:惠普支持产品:笔记本电脑,台式机,显示器维修项目:不开机,死机重启,清理除尘,数据恢复等郑州市黄河南街与同...

全部游戏大全免费安装(全部游戏免费软件)
  • 全部游戏大全免费安装(全部游戏免费软件)
  • 全部游戏大全免费安装(全部游戏免费软件)
  • 全部游戏大全免费安装(全部游戏免费软件)
  • 全部游戏大全免费安装(全部游戏免费软件)
电脑怎么安装win10装系统(电脑怎么安装win10装系统按哪个键)

Windows10系统安装教程如下:准备好所需的文件和文件夹,包括安装介质(例如安装光盘、USB闪存驱动器或网络安装介质),以及需要包含Windows10镜像文件的文件和文件夹...

国内哪个ai写代码最强(ai用什么代码编程)

是的,coloros小布ai可以写代码。它具有图灵完备的编程能力,并且可以通过编程语言进行逻辑推理和计算,实现各种功能。通过编程,可以让coloros小布ai执行特定的任务、完成复杂的计算和处理数据,...