python编程实践:下载文件模块wget的使用
liuian 2025-01-06 14:02 49 浏览
wget是Linux中的一个下载文件的工具,是在Linux下开发的开放源代码的软件,后来被移植到包括Windows在内的各个平台上,也就是wget目前是跨平台的下载软件了。wget工具体积小但功能完善,它支持断点下载功能,同时支持http,https,ftp协议下载方式,支持http代理服务器和设置起来方便简单。
本教程,不是介绍wget软件的如何使用,而是介绍如何在 Python 中使用 wget 模块进行文件下载。通过使用 wget 库,我们可以轻松地从网络上下载各种文件,如文本、图像、视频、音频、压缩、grib2等文件,也就是说所有文件都能下载,当然需要服务器支持,服务器不支持下载的文件,你也下载不了。
网络上有wget模块的讲解,但是大多不系统、不全面。应粉丝的要求,本人通过网络搜索整理、查看源代码、加上自己的理解和实践,形成本教程。
一、安装wget模块
pip install wget
目前wget的版本是3.2。
二、wget模块参数说明
wget.download(url, out=None, bar=bar_adaptive)
- url:要下载的url。下载url到系统的临时目录中,然后从URL或HTTP headers自动检测文件名并命名,如果当前有相同的名字,则自动改名,添加“(1)(2)”等字符。
- out:输出文件名或目录
- bar:跟踪下载进度的函数(可视化等)
- return:返回url被下载到的文件名
三、下载文件
下载文件实例1:
url:是我随便在网上找的一个链接。它是一个压缩软件执行程序。
import wget
url = 'https://motzdown.mydown.com/package/wincompress_1/win%E8%A7%A3%E5%8E%8B%E7%BC%A9_1800_1_31_2528.exe'
localfile = wget.download(url)
print(localfile) #win%E8%A7%A3%E5%8E%8B%E7%BC%A9_1800_1_31_2528 1.exe
返回的是:win%E8%A7%A3%E5%8E%8B%E7%BC%A9_1800_1_31_2528 1.exe,也就是下载的文件名。
下载文件实例2:
下载文件并保存在当前目录下。
import wget
url = 'https://motzdown.mydown.com/package/wincompress_1/win%E8%A7%A3%E5%8E%8B%E7%BC%A9_1800_1_31_2528.exe'
localfile = './win解压缩_1800_1_31_2528.exe'
wget.download(url,out=localfile)
运行的效果下图所示。
它有一个默认的下载进度栏,非常直观和方便。
三、设置代理
有时,我们下载文件的过程中,需要用到http代理服务器来下载文件,这时怎么办,wget 模块也提供了相应的功能。这时我们可以使用 proxy参数来指定http代理服务器的地址。示例如下:
import wget
url = 'https://xxx.xxx.com/test.rar'
localfile = './test.rar'
proxy = 'http://proxy.xxx.xxx.com:20080'
wget.download(url, localfile, proxy=proxy)
四、下载进度
翻看wget的源程序,bar_adaptive函数就是它下载文件的进度显示的函数。它有三个参数,current:当前已经下载文件的大小, total:文件的大小, width=80:显示字符的宽度。
这个例子我就不具体讲解了,有兴趣的可以仔细学习一下。
def bar_adaptive(current, total, width=80):
"""Return progress bar string for given values in one of three
styles depending on available width:
[.. ] downloaded / total
downloaded / total
[.. ]
if total value is unknown or <= 0, show bytes counter using two
adaptive styles:
%s / unknown
%s
if there is not enough space on the screen, do not display anything
returned string doesn't include control characters like \r used to
place cursor at the beginning of the line to erase previous content.
this function leaves one free character at the end of string to
avoid automatic linefeed on Windows.
"""
# process special case when total size is unknown and return immediately
if not total or total < 0:
msg = "%s / unknown" % current
if len(msg) < width: # leaves one character to avoid linefeed
return msg
if len("%s" % current) < width:
return "%s" % current
# --- adaptive layout algorithm ---
#
# [x] describe the format of the progress bar
# [x] describe min width for each data field
# [x] set priorities for each element
# [x] select elements to be shown
# [x] choose top priority element min_width < avail_width
# [x] lessen avail_width by value if min_width
# [x] exclude element from priority list and repeat
# 10% [.. ] 10/100
# pppp bbbbb sssssss
min_width = {
'percent': 4, # 100%
'bar': 3, # [.]
'size': len("%s" % total)*2 + 3, # 'xxxx / yyyy'
}
priority = ['percent', 'bar', 'size']
# select elements to show
selected = []
avail = width
for field in priority:
if min_width[field] < avail:
selected.append(field)
avail -= min_width[field]+1 # +1 is for separator or for reserved space at
# the end of line to avoid linefeed on Windows
# render
output = ''
for field in selected:
if field == 'percent':
# fixed size width for percentage
output += ('%s%%' % (100 * current // total)).rjust(min_width['percent'])
elif field == 'bar': # [. ]
# bar takes its min width + all available space
output += bar_thermometer(current, total, min_width['bar']+avail)
elif field == 'size':
# size field has a constant width (min == max)
output += ("%s / %s" % (current, total)).rjust(min_width['size'])
selected = selected[1:]
if selected:
output += ' ' # add field separator
return output
下面我给出了三个小例子,希望给大家以启迪。
例子1,显示直接用sys.stdout.write,而且用了"\r"符号,只回车不换行。也就是从头开始显示,但不换新行。
import sys
import wget
url = 'https://motzdown.mydown.com/package/wincompress_1/win%E8%A7%A3%E5%8E%8B%E7%BC%A9_1800_1_31_2528.exe'
localfile = './win解压缩_1800_1_31_2528.exe'
def bar_progress(current, total, width=80):
progress_message = "Downloading: %d%% [%d / %d] bytes" % (current / total * 100, current, total)
# 不要使用print(),因为它显示,总是会另起新的一行显示。
sys.stdout.write("\r" + progress_message)
sys.stdout.flush()
wget.download(url,out=localfile,bar=bar_progress)
运行效果如下:
例子2,和例子1类似,但是实现了下载的进度条。
import sys
import wget
url = 'https://motzdown.mydown.com/package/wincompress_1/win%E8%A7%A3%E5%8E%8B%E7%BC%A9_1800_1_31_2528.exe'
localfile = './win解压缩_1800_1_31_2528.exe'
def progress_bar(current, total, width=80):
progress = current / total
bar = '#' * int(progress * width)
percentage = round(progress * 100, 2)
tempstr = f'[{bar:<{width}}] {percentage}%'
sys.stdout.write("\r" + tempstr)
sys.stdout.flush()
wget.download(url,out=localfile,bar=progress_bar)
运行效果如下:
例子3,是在和例子2基础上改写,进度条从“######”改为“..........”,没有使用sys.stdout.write,而是直接返回要显示的字符串。
这就是直接仿照官方源代码改写的。也就是说,自定义的进度条,只需要返回要显示的字符串即可。
import sys
import wget
url = 'https://motzdown.mydown.com/package/wincompress_1/win%E8%A7%A3%E5%8E%8B%E7%BC%A9_1800_1_31_2528.exe'
localfile = './win解压缩_1800_1_31_2528.exe'
def progress_bar(current, total, width=80):
progress = current / total
bar = '.' * int(progress * width)
percentage = round(progress * 100, 2)
tempstr = f'[{bar:<{width}}] {percentage}%'
return tempstr
wget.download(url,out=localfile,bar=progress_bar)
运行效果如下:
需要说明的是,有时您下载的文件大小,服务器没有给出,这时total的数值就不知道。对于这一点,bar_adaptive的代码考虑得非常全面。本教程给的三个自定义进度函数,没有考虑这种情况,如果遇见这种情况,程序会出错退出的。有兴趣的粉丝,可以参照bar_adaptive的代码进行完善。有不懂的,可以在评论区讨论。
五、异常处理
在使用 wget 进行文件下载时,不可避免地会遇到一些异常的情况,如连接到服务器出现问题、下载过程中出现中断或出现错误等。为了确保程序的不意外中断、能继续执行后面的任务,我们可以使用异常处理来处理这些异常情况,这样我们可以根据日志来判断程序执行的情况,从而采取具体的处理措施。当然这种异常处理是一般程序的处理方法,这里只是介绍,非wget所独有。示例如下:
try:
wget.download(url, localfile)
except Exception as e:
print(f'An error occurred: {e}')
相关推荐
- 快速上手maven
-
Maven的作用在开发过程中需要用到各种各样的jar包,查找和下载这些jar包是件费时费力的事,特别是英文官方网站,可以将Maven看成一个整合了所有开源jar包的合集,我们需要jar包只需要从Mav...
- Windows系统——配置java环境变量
-
怎么配置java环境变量呢?首先是安装好jdk然后我的电脑右键选择属性然后选择左侧高级系统设置高级然后点环境变量然后在用户变量或系统变量中配置,用户变量指的是只有当前用户可用,系统变量指的是系统中...
- ollama本地部署更改默认C盘,Windows配置环境变量方法
-
ollama是一个大语言模型(LLM——LargeLanguageModel),本地电脑安装网上也要很多教程,看上去非常简单,一直下一步,然后直接就可以使用了。但是我在实操的时候并不是这样,安装完...
- # Windows 环境变量 Path 显示样式更改
-
#怎样学习Java##Windows环境变量Path显示样式更改##1、传统Path环境变量显示:```---》键盘上按【WIN+I】打开系统【设置】---》依次点击---》【系统...
- 如何在Windows中创建用户和系统环境变量
-
在Windows中创建环境变量之前您应该了解的事情在按照本指南中所示的任何步骤创建指向文件夹、文件或其他任何内容的用户和系统变量之前,您应该了解两件事。第一个也是最重要的一个是了解什么是环境变量。...
- Windows 中的环境变量是什么?
-
Windows中的环境变量是什么?那么,Windows中的环境变量是什么?简而言之,环境变量是描述应用程序和程序运行环境的变量。所有类型的程序都使用环境变量来回答以下问题:我安装的计算机的名称是什么...
- 【Python程序开发系列】谈一谈Windows环境变量:系统和用户变量
-
这是我的第350篇原创文章。一、引言环境变量(environmentvariables)一般是指在操作系统中用来指定操作系统运行环境的一些参数,如:临时文件夹位置和系统文件夹位置等。环境变量是在操作...
- 系统小技巧:还原Windows10路径环境变量
-
有时,我们在Windows10的“运行”窗口中执行一些命令或运行一些程序,这时即便没有指定程序的具体路径,只输入程序的名称(如notepad.exe),便可以迅速调用成功。这是因为Windows默认...
- Windows10系统的“环境变量”在哪里呢?
-
当我们在操作系统是Windows10的电脑里安装了一些软件,要通过配置环境变量才能使用软件时,在哪里能找到“环境变量”窗口呢?可以按照下面的步骤找到“环境变量”。说明:下面的步骤和截图是在Window...
- 系统小技巧:彻底弄懂Windows 10环境变量
-
每当我们进行系统清理时,清理软件总能自动找到Windows的临时文件夹之所在,然后加以清理,即便是我们重定向了TEMP目录也是如此。究其原因,是因为清理软件会根据TEMP环境变量来判断现有临时文件夹的...
- MySQL 5.7 新特性大全和未来展望
-
本文转自微信公众号:高可用架构作者:杨尚刚引用美图公司数据库高级DBA,负责美图后端数据存储平台建设和架构设计。前新浪高级数据库工程师,负责新浪微博核心数据库架构改造优化,以及数据库相关的服务器存...
- MySQL系列-源码编译安装(v8.0.25)
-
一、前言生产环境建议使用二进制安装法,其优点是部署简单、快速、方便,并且相对"yum/rpm安装"方法能更方便地自定义文件存放的目录结构,方便用脚本批量部署,方便日后运维管理。在生产...
- MySQL如何实时同步数据到ES?试试这款阿里开源的神器!
-
前几天在网上冲浪的时候发现了一个比较成熟的开源中间件——Canal。在了解了它的工作原理和使用场景后,顿时产生了浓厚的兴趣。今天,就让我们跟随我的脚步,一起来揭开它神秘的面纱吧。简介canal翻译为...
- 技术老兵十年专攻MySQL:编写了763页核心总结,90%MySQL问题全解
-
MySQL是开放源码的关系数据库管理系统,由于性能高、成本低、可靠性好,成为现在最流行的开源数据库。MySQL学习指南笔记领取方式:关注、转发后私信小编【111】即可免费获得《MySQL进阶笔记》的...
- Mysql和Hive之间通过Sqoop进行数据同步
-
文章回顾理论大数据框架原理简介大数据发展历程及技术选型实践搭建大数据运行环境之一搭建大数据运行环境之二本地MAC环境配置CPU数和内存大小查看CPU数sysctl machdep.cpu...
- 一周热门
-
-
Python实现人事自动打卡,再也不会被批评
-
【验证码逆向专栏】vaptcha 手势验证码逆向分析
-
Psutil + Flask + Pyecharts + Bootstrap 开发动态可视化系统监控
-
一个解决支持HTML/CSS/JS网页转PDF(高质量)的终极解决方案
-
再见Swagger UI 国人开源了一款超好用的 API 文档生成框架,真香
-
网页转成pdf文件的经验分享 网页转成pdf文件的经验分享怎么弄
-
C++ std::vector 简介
-
系统C盘清理:微信PC端文件清理,扩大C盘可用空间步骤
-
飞牛OS入门安装遇到问题,如何解决?
-
10款高性能NAS丨双十一必看,轻松搞定虚拟机、Docker、软路由
-
- 最近发表
- 标签列表
-
- python判断字典是否为空 (50)
- crontab每周一执行 (48)
- aes和des区别 (43)
- bash脚本和shell脚本的区别 (35)
- canvas库 (33)
- dataframe筛选满足条件的行 (35)
- gitlab日志 (33)
- lua xpcall (36)
- blob转json (33)
- python判断是否在列表中 (34)
- python html转pdf (36)
- 安装指定版本npm (37)
- idea搜索jar包内容 (33)
- css鼠标悬停出现隐藏的文字 (34)
- linux nacos启动命令 (33)
- gitlab 日志 (36)
- adb pull (37)
- python判断元素在不在列表里 (34)
- python 字典删除元素 (34)
- vscode切换git分支 (35)
- python bytes转16进制 (35)
- grep前后几行 (34)
- hashmap转list (35)
- c++ 字符串查找 (35)
- mysql刷新权限 (34)