百度360必应搜狗淘宝本站头条
当前位置:网站首页 > IT知识 > 正文

python编程实践:下载文件模块wget的使用

liuian 2025-01-06 14:02 44 浏览

wget是Linux中的一个下载文件的工具,是在Linux下开发的开放源代码的软件,后来被移植到包括Windows在内的各个平台上,也就是wget目前是跨平台的下载软件了。wget工具体积小但功能完善,它支持断点下载功能,同时支持http,https,ftp协议下载方式,支持http代理服务器和设置起来方便简单。

本教程,不是介绍wget软件的如何使用,而是介绍如何在 Python 中使用 wget 模块进行文件下载。通过使用 wget 库,我们可以轻松地从网络上下载各种文件,如文本、图像、视频、音频、压缩、grib2等文件,也就是说所有文件都能下载,当然需要服务器支持,服务器不支持下载的文件,你也下载不了。

网络上有wget模块的讲解,但是大多不系统、不全面。应粉丝的要求,本人通过网络搜索整理、查看源代码、加上自己的理解和实践,形成本教程。

一、安装wget模块

pip install wget

目前wget的版本是3.2。

二、wget模块参数说明

wget.download(url, out=None, bar=bar_adaptive)
  • url:要下载的url。下载url到系统的临时目录中,然后从URL或HTTP headers自动检测文件名并命名,如果当前有相同的名字,则自动改名,添加“(1)(2)”等字符。
  • out:输出文件名或目录
  • bar:跟踪下载进度的函数(可视化等)
  • return:返回url被下载到的文件名

三、下载文件

下载文件实例1:

url:是我随便在网上找的一个链接。它是一个压缩软件执行程序。

import wget
url = 'https://motzdown.mydown.com/package/wincompress_1/win%E8%A7%A3%E5%8E%8B%E7%BC%A9_1800_1_31_2528.exe'
localfile = wget.download(url)
print(localfile)  #win%E8%A7%A3%E5%8E%8B%E7%BC%A9_1800_1_31_2528 1.exe

返回的是:win%E8%A7%A3%E5%8E%8B%E7%BC%A9_1800_1_31_2528 1.exe,也就是下载的文件名。
下载文件实例2:

下载文件并保存在当前目录下。

import wget
url = 'https://motzdown.mydown.com/package/wincompress_1/win%E8%A7%A3%E5%8E%8B%E7%BC%A9_1800_1_31_2528.exe'
localfile = './win解压缩_1800_1_31_2528.exe'
wget.download(url,out=localfile)

运行的效果下图所示。

它有一个默认的下载进度栏,非常直观和方便。

三、设置代理

有时,我们下载文件的过程中,需要用到http代理服务器来下载文件,这时怎么办,wget 模块也提供了相应的功能。这时我们可以使用 proxy参数来指定http代理服务器的地址。示例如下:

import wget
url = 'https://xxx.xxx.com/test.rar'
localfile = './test.rar'
proxy = 'http://proxy.xxx.xxx.com:20080'
wget.download(url, localfile, proxy=proxy)

四、下载进度

翻看wget的源程序,bar_adaptive函数就是它下载文件的进度显示的函数。它有三个参数,current:当前已经下载文件的大小, total:文件的大小, width=80:显示字符的宽度。

这个例子我就不具体讲解了,有兴趣的可以仔细学习一下。

def bar_adaptive(current, total, width=80):
    """Return progress bar string for given values in one of three
    styles depending on available width:

        [..  ] downloaded / total
        downloaded / total
        [.. ]

    if total value is unknown or <= 0, show bytes counter using two
    adaptive styles:

        %s / unknown
        %s

    if there is not enough space on the screen, do not display anything

    returned string doesn't include control characters like \r used to
    place cursor at the beginning of the line to erase previous content.

    this function leaves one free character at the end of string to
    avoid automatic linefeed on Windows.
    """

    # process special case when total size is unknown and return immediately
    if not total or total < 0:
        msg = "%s / unknown" % current
        if len(msg) < width:    # leaves one character to avoid linefeed
            return msg
        if len("%s" % current) < width:
            return "%s" % current

    # --- adaptive layout algorithm ---
    #
    # [x] describe the format of the progress bar
    # [x] describe min width for each data field
    # [x] set priorities for each element
    # [x] select elements to be shown
    #   [x] choose top priority element min_width < avail_width
    #   [x] lessen avail_width by value if min_width
    #   [x] exclude element from priority list and repeat
    
    #  10% [.. ]  10/100
    # pppp bbbbb sssssss

    min_width = {
      'percent': 4,  # 100%
      'bar': 3,      # [.]
      'size': len("%s" % total)*2 + 3, # 'xxxx / yyyy'
    }
    priority = ['percent', 'bar', 'size']

    # select elements to show
    selected = []
    avail = width
    for field in priority:
      if min_width[field] < avail:
        selected.append(field)
        avail -= min_width[field]+1   # +1 is for separator or for reserved space at
                                      # the end of line to avoid linefeed on Windows
    # render
    output = ''
    for field in selected:

      if field == 'percent':
        # fixed size width for percentage
        output += ('%s%%' % (100 * current // total)).rjust(min_width['percent'])
      elif field == 'bar':  # [. ]
        # bar takes its min width + all available space
        output += bar_thermometer(current, total, min_width['bar']+avail)
      elif field == 'size':
        # size field has a constant width (min == max)
        output += ("%s / %s" % (current, total)).rjust(min_width['size'])

      selected = selected[1:]
      if selected:
        output += ' '  # add field separator

    return output

下面我给出了三个小例子,希望给大家以启迪。

例子1,显示直接用sys.stdout.write,而且用了"\r"符号,只回车不换行。也就是从头开始显示,但不换新行。

import sys
import wget

url = 'https://motzdown.mydown.com/package/wincompress_1/win%E8%A7%A3%E5%8E%8B%E7%BC%A9_1800_1_31_2528.exe'
localfile = './win解压缩_1800_1_31_2528.exe'

def bar_progress(current, total, width=80):
     progress_message = "Downloading: %d%% [%d / %d] bytes" % (current / total * 100, current, total)
     # 不要使用print(),因为它显示,总是会另起新的一行显示。
     sys.stdout.write("\r" + progress_message)
     sys.stdout.flush()

wget.download(url,out=localfile,bar=bar_progress)

运行效果如下:

例子2,和例子1类似,但是实现了下载的进度条。

import sys
import wget

url = 'https://motzdown.mydown.com/package/wincompress_1/win%E8%A7%A3%E5%8E%8B%E7%BC%A9_1800_1_31_2528.exe'
localfile = './win解压缩_1800_1_31_2528.exe'

def progress_bar(current, total, width=80):
    progress = current / total
    bar = '#' * int(progress * width)
    percentage = round(progress * 100, 2)
    tempstr = f'[{bar:<{width}}] {percentage}%'
    sys.stdout.write("\r" + tempstr)
    sys.stdout.flush()

wget.download(url,out=localfile,bar=progress_bar)

运行效果如下:

例子3,是在和例子2基础上改写,进度条从“######”改为“..........”,没有使用sys.stdout.write,而是直接返回要显示的字符串。

这就是直接仿照官方源代码改写的。也就是说,自定义的进度条,只需要返回要显示的字符串即可。

import sys
import wget

url = 'https://motzdown.mydown.com/package/wincompress_1/win%E8%A7%A3%E5%8E%8B%E7%BC%A9_1800_1_31_2528.exe'
localfile = './win解压缩_1800_1_31_2528.exe'

def progress_bar(current, total, width=80):
    progress = current / total
    bar = '.' * int(progress * width)
    percentage = round(progress * 100, 2)
    tempstr = f'[{bar:<{width}}] {percentage}%'
    return tempstr 

wget.download(url,out=localfile,bar=progress_bar)

运行效果如下:

需要说明的是,有时您下载的文件大小,服务器没有给出,这时total的数值就不知道。对于这一点,bar_adaptive的代码考虑得非常全面。本教程给的三个自定义进度函数,没有考虑这种情况,如果遇见这种情况,程序会出错退出的。有兴趣的粉丝,可以参照bar_adaptive的代码进行完善。有不懂的,可以在评论区讨论。

五、异常处理

在使用 wget 进行文件下载时,不可避免地会遇到一些异常的情况,如连接到服务器出现问题、下载过程中出现中断或出现错误等。为了确保程序的不意外中断、能继续执行后面的任务,我们可以使用异常处理来处理这些异常情况,这样我们可以根据日志来判断程序执行的情况,从而采取具体的处理措施。当然这种异常处理是一般程序的处理方法,这里只是介绍,非wget所独有。示例如下:

try:
    wget.download(url,  localfile)
except Exception as e:
    print(f'An error occurred: {e}')

相关推荐

HR必备Excel函数:4个与日期相关的计算函数。

提到日期函数,很多人首先会想到“today”,它可以显示当天的日期,并且每次打开表格时都会自动更新。但是,对于前天、昨天、明天和后天的日期,就不能用yesterday或者tomorrow等这些英文了,...

这篇文章有点长,但可以让你十分钟玩转Excel的时间函数

日期与时间函数——TODAY、NOW、YEAR、MONTH、DAY!如何用WORKDAY函数查询距离某天的第20个工作日是哪一天?如何用NETWORKDAYS函数查询员工工作了多少个工作日?如何用WE...

Excel2020年日历套装,表格设计,农历显示,查阅套打轻松应用

Hello大家好,我是帮帮。今天跟大家分享一组Excel2020年日历套装,表格设计,自带农历控件,查阅套打轻松应用。有个好消息!为了方便大家更快的掌握技巧,寻找捷径。请大家点击文章末尾的“了解更多”...

巧用NETWORKDAYS函数计算两个日期之间工作日的天数

带有日期的单元格是我们日常使用EXCEL的时候经常见到的,有的时候我们需要求出两个日期之间间隔的天数,可以直接用结束日期减去开始日期即可,这是个非常简单的减法公式。不过这个单纯的减法公式会默认去掉开始...

Excel按工作日、休息日进行汇总

1、按周六日/其它时间汇总为了区分一周的周六日和其它时间,可以使用WEEKDAY函数,把WEEKDAY函数的第2个参数指定为2,如WEEKDAY(A3,2),则周一返回1,周二返回2,…,周六返回...

如何计算每月应出勤天数,如有法定假期和调休,如何计算

本文介绍如何计算每月的应出勤天数。第一部分介绍正常双休制下计算应出勤天数;第二部份介绍当月有法定假期和调休的情况下计算应出勤天数。一、计算正常双休制的应出勤天数如下图所示,要求计算各员工2021年3月...

《Excel一键生成工作日历:让会议排期更轻松!》

每当需要安排会议时,总要翻看日历确认工作日,再逐个标注会议时间,既耗时又容易出错。今天教大家用Excel快速生成工作日历表,让会议排期变得简单高效!一、快速生成日历框架创建基础日期:在A1单元格输入月...

如何计算指定日期区间内,有多少工作日和休息日?

大家好,今天咱们要解决的问题是如何计算给定的一段日期内,正常工作日有多少天,放假时间有多少天?比如咱们要计算2025年3月份工作日一共有多少天,又有多少天放假,如下图所示:通过肉眼我们可以数清楚,20...

如何如何在表格中自动突出显示双休日?

现在不少人喜欢用Excel来制作备忘录或安排工作事项。在表格中输入日期后,可以使用条件格式突出显示双休日,避免在休息日安排了工作。具体方法是这样的:第1步:选择要设置条件格式的日期单元格区域;在“开始...

excel函数技巧:networkdays.intl判断节假日

如图,想知道6月的每一天是否是节假日,公式如下:=NETWORKDAYS.INTL(A2,A2,1,$E$2:$E$28)这个函数既可以判断当前日期(一参=二参)是否是周末及工作日(三参、四参)还可得...

仅需3步,让考勤表根据实际休息日,自动地填充颜色

Hello,大家好,之前跟大家分享了我们如何让考勤表根据单休与双休自动的填充颜色,最近有粉丝问到:能不能让考勤表根据实际的休息日自动的填充颜色呢?可以是可以,只不过因为牵扯到假期调休,我们每年的休息日...

5步搞定动态考勤表!标记节假日、调休日?Excel自动变色!

今天教你用「动态考勤表」一招解决所有问题!只需输入月份,自动变色、自动更新节假日,从此告别加班,效率翻倍!动态考勤表的优势:自动变色:节假日、双休日一键标记,颜色分明。一表多用:修改月份即可...

一起用python做个炫酷音乐播放器,想听啥随便搜

前言前段时间写的Python自制一款炫酷音乐播放器,有不少小伙伴私信我,对播放器提了不少改进建议,让我完善播放器的功能。今天音乐播放器2.0版本完成了,大家一起来看看是如何用python自制一款炫酷的...

用Python做个“冰墩墩雪容融”桌面部件(好玩又有趣)

桌面太单调?今天就带大家,一起用Python的PyQt5开发一个有趣的自定义桌面动画挂件,看看实现的动画挂件效果!下面,我们开始介绍这个自定义桌面动画挂件的制作过程。一、核心功能设计实现将动态图gif...

Python串口调试助手源码分享

以下是一个基于Python和PyQt5实现的串口调试助手示例,包含核心功能实现代码:pythonimportsysimportserialfromPyQt5.QtCoreimportQTim...