新一代爬虫利器Python Playwright详解

来自：网络

时间：2021-12-20

阅读：

Playwright是Microsoft在2020年初开源的新一代自动化测试工具，它的功能类似于Selenium、Pyppeteer等，都可以驱动浏览器进行各种自动化操作。它的功能也非常强大，对市面上主流浏览器都提供了支持，API功能简洁又强大。虽然诞生的比较晚，但是发展得非常火热。

在Pyppeteer已经不再维护的年代，拥有Playwright这个开源工具是非常棒的选择，文档丰富，功能强大。

安装方式

conda config --add channels conda-forge
conda config --add channels microsoft
conda install playwright
playwright install

上述命令的具体运行过程是下载Playwright并将其打包为Chromium、Firefox和Webkit安装浏览器二进制文件。

特点

Playwright支持当前所有主流浏览器，包括Chrome和Edge（基于Chromium）、Firefox、Safari（基于Webkit），提供完善的自动化控制的API。
Playwright支持移动端页面的测试，使用设备模拟技术可以在移动web浏览器中测试响应式web应用程序。
Playwright支持所有浏览器的Headless模式和非Headless模式的测试。
Playwright的安装配置非常的简单，安装过程中会自动安装对应浏览器的驱动，不需要额外的配置WebDriver等。
Playwright提供了大量的与自动化相关的API，当页面加载时会自动等待对应节点的加载，大大的简化了编写API的难度。

使用方式

在python脚本中导入Playwright，并启动3种浏览器（Chromium、Friefox和webkit）的其中一种。Playwright支持两种编写模式，一种是Pyppeter一样的异步模式，另一种是像Selenium一样的同步模式，我们可以根据实际的需要选择不同的模式。

下面我们先来看看一个基本同步模式的例子：

from playwright.sync_api import sync_playwright
with sync_playwright() as p:
    for browser_type in [p.chromium, p.firefox, p.webkit]:
        browser = browser_type.launch(headless=False)
        page = browser.new_page()
        page.goto("https://www.baidu.com")
        page.screenshot(path=f"screenshot-{browser_type.name}.png")
        print(page.title())
        browser.close()

首先在这里我们导入了sync_playwright方法，然后调用这个方法，该方法返回的是一个PlaywrightContextManager对象，可以将其理解为浏览器的上下文管理器，这里将其赋值给变量p。接着调用PlaywrightContextManager对象的chromium、firefox、webkit浏览器实例，接着使用for循环依次去执行它们的launch方法，同时设置headless为False。

这里有一个注意点：如果launch没有设置为Flase，默认是无头模式启动浏览器，我们看不到任何的窗口。

launch方法返回的是一个浏览器（Browser）对象，我们将其复制为browser变量，然后调用new_page方法，相当于是新建一个选显卡，返回page对象并赋值给变量page，接下来就是调用page对象的一系列自动化API进行操作。当页面加载完毕之后生成截图、控制台输出结果就退出，上面的代码，调用了page对象的两个方法：

1、screenshot：参数传一个文件的名称，这样截图就会自动保存为该文件的名称。

2、title：返回页面的标题。

这时当前目录便会产生三个截图文件，都是百度的首页，文件名中都带有浏览器的名称，如图所示：

控制台运行结果：

百度一下，你就知道
百度一下，你就知道
百度一下，你就知道

除了上面所描述的同步模式之外，Playwright还支持异步模式，如果在项目中使用了asyncio，那么就应该是考虑要采用异步模式，使用异步的API，写法如下：

import asyncio
from playwright.async_api import async_playwright

async def main():
    async with async_playwright() as p:
        for browser_type in [p.chromium, p.firefox, p.webkit]:
            browser = await browser_type.launch()
            page = await browser.new_page()
            await page.goto("https://www.baidu.com")
            await page.screenshot(path=f"screenshot-{browser_type.name}.png")
            print(await page.title())
            await browser.close()
asyncio.run(main())

从上面的代码可以看出，整个写法和同步模式是很相似的。

注意：

1、导入的是async_playwright方法

2、在写法上添加 async/await 关键字。

代码生成

Playwright还有一个强大的功能，那就是可以录制我们在浏览器的操作，并将操作时的代码自动生成。这个功能可以通过Playwright命令调用codegen来实现，我们先看看codegen命令都有什么参数。

playwright codegen --help

结果类似如下：

Usage: npx playwright codegen [options] [url]

open page and generate code for user actions

Options:
-o, --output <file name> saves the generated script to a file
--target <language> language to generate, one of javascript, test, python, python-async, csharp (default:
"python")
-b, --browser <browserType> browser to use, one of cr, chromium, ff, firefox, wk, webkit (default: "chromium")
--channel <channel> Chromium distribution channel, "chrome", "chrome-beta", "msedge-dev", etc
--color-scheme <scheme> emulate preferred color scheme, "light" or "dark"
--device <deviceName> emulate device, for example "iPhone 11"
--geolocation <coordinates> specify geolocation coordinates, for example "37.819722,-122.478611"
--ignore-https-errors ignore https errors
--load-storage <filename> load context storage state from the file, previously saved with --save-storage
--lang <language> specify language / locale, for example "en-GB"
--proxy-server <proxy> specify proxy server, for example "http://myproxy:3128" or "socks5://myproxy:8080"
--save-storage <filename> save context storage state at the end, for later use with --load-storage
--save-trace <filename> record a trace for the session and save it to a file
--timezone <time zone> time zone to emulate, for example "Europe/Rome"
--timeout <timeout> timeout for Playwright actions in milliseconds (default: "10000")
--user-agent <ua string> specify user agent string
--viewport-size <size> specify browser viewport size in pixels, for example "1280, 720"
-h, --help display help for command

Examples:

$ codegen
$ codegen --target=python
$ codegen -b webkit https://example.com

在上面可以看到有几个选项，比如

-o表示输出代码文件的名称；
–target表示所使用的语言，默认是python，即会生成同步模式的操作代码，如果传入的是python-async则会生成异步模式的操作代码；
-b表示使用的浏览器类型，默认是Chrome浏览器；
–device可以模拟使用手机浏览器；
–lang表示设置浏览器语言，
–timeout可以设置页面加载超时时间。

了解这些用法之后，我们就来尝试启动Chrome浏览器，然后将操作结果输出到test3.py，命令如下：

playwright codegen -o test3.py --target python-async

可以看到浏览器还会高亮显示正在操作的节点，同时还显示了节点名称。

在操作的过程中代码是实时变化的。操作完毕之后即可关闭浏览器，Playwright会生成一个test3.py文件，内容如下：

import asyncio
from playwright.async_api import Playwright, async_playwright
async def run(playwright: Playwright) -> None:
    browser = await playwright.chromium.launch(headless=False)
    context = await browser.new_context()
    # Open new page
    page = await context.new_page()
    # Go to https://www.baidu.com/
    await page.goto("https://www.baidu.com/")
    # Click input[name="wd"]
    await page.click("input[name=\"wd\"]")
    # Click input[name="wd"]
    await page.click("input[name=\"wd\"]")
    # Fill input[name="wd"]
    await page.fill("input[name=\"wd\"]", "如何榜上富婆")
    # Click text=百度一下
    # async with page.expect_navigation(url="https://www.baidu.com/s?ie=utf-8&f=8&rsv_bp=1&rsv_idx=1&tn=baidu&wd=%E5%A6%82%E4%BD%95%E6%A6%9C%E4%B8%8A%E5%AF%8C%E5%A9%86&fenlei=256&rsv_pq=ca59e3ec000cf6aa&rsv_t=5f82kcndi6iqNSwqOVo5sd%2BHSoqhzQHKLGVs1HFegxx02UtWAA5gHQbWBfw&rqlang=cn&rsv_enter=0&rsv_dl=tb&rsv_sug3=24&rsv_sug1=14&rsv_sug7=100&rsv_btype=i&prefixsug=%25E5%25A6%2582%25E4%25BD%2595%25E6%25A6%259C%25E4%25B8%258A%25E5%25AF%258C%25E5%25A9%2586&rsp=4&inputT=8686&rsv_sug4=68370&rsv_jmp=fail"):
    async with page.expect_navigation():
        await page.click("text=百度一下")
    # assert page.url == "https://www.baidu.com/s?ie=utf-8&f=8&rsv_bp=1&rsv_idx=1&tn=baidu&wd=%E5%A6%82%E4%BD%95%E6%A6%9C%E4%B8%8A%E5%AF%8C%E5%A9%86&fenlei=256&rsv_pq=ca59e3ec000cf6aa&rsv_t=5f82kcndi6iqNSwqOVo5sd%2BHSoqhzQHKLGVs1HFegxx02UtWAA5gHQbWBfw&rqlang=cn&rsv_enter=0&rsv_dl=tb&rsv_sug3=24&rsv_sug1=14&rsv_sug7=100&rsv_btype=i&prefixsug=%25E5%25A6%2582%25E4%25BD%2595%25E6%25A6%259C%25E4%25B8%258A%25E5%25AF%258C%25E5%25A9%2586&rsp=4&inputT=8686&rsv_sug4=68370"
    # Close page
    await page.close()
    # ---------------------
    await context.close()
    await browser.close()
async def main() -> None:
    async with async_playwright() as playwright:
        await run(playwright)
asyncio.run(main())

可以看到这里的代码和我们之前编写的代码基本类似，而且也是完全可以运行的，运行之后就可以看到它又复现了我们刚才的动作。

另外这里的new_page并不是通过browser调用的，而是通过context变量调用的，context又是通过Browser对象调用的。这里的context变量相当于一个BrowserContext对象，它是一个类似于隐身模式的独立上下文环境，其运行资源是隔离的，保证互不干扰。

选择器

Playwright的文档非常的丰富，可以直接参考https://playwright.dev/python/docs/selectors

事件监听

page对象提供了一个on方法，它可以用来监听页面中各个事件，比如close、console、load、request、response等等。

比如我们可以监听response事件，response事件可以在每次网络请求得到响应的时候触发，我们可以设置对应的回调方法获取对应的Response的全部信息。

from playwright.sync_api import sync_playwright

def on_response(response):
    print(f'Statue {response.status}:{response.url}')
with sync_playwright() as p:
    browser = p.chromium.launch(headless=False)
    page = browser.new_page()
    page.on('response', on_response)
    page.goto('https://www.kenshujun.cn/')
    page.wait_for_load_state('networkidle')
    browser.close()

创建page对象之后，就开始监听response事件，同时将回调方法设置为on_response，on_response对象接受一个参数，然后把状态码和连接都输出来。

看可以看到这里输出的结果与浏览器Network面板所加载的内容是一样的。

总结

本篇文章就到这里了，希望能够给你带来帮助，也希望您能够多多关注的更多内容!

目录 Python 日期和时间戳的转换 Python中处理时间的模块 Python的time模块将时间戳转换为格式化字符串 Python 的datetime模块 datetime模块中定义的类（这些

2024-10-20 21:50:48

目录 1. 异步组件 1.1 使用 defineAsyncComponent 1.2 预加载 2. 路由懒加载 3. 动态组件 4. 事件触发的动态加载 5. 按需加载与状态管理结合结论 1. 异步组

2024-10-20 21:50:41

目录引言使用Python保存PPT中的所有形状为图像文件用Python保存PPT中带格式设计的图片为图像文件引言将PowerPoint演示文稿中的形状（幻灯片中的内容元素，包括文本框、图形

2024-10-20 21:50:28

目录前言用Python删除PDF文档页边距前言在处理PDF文档时，有时候我们会遇到PDF文件带有较大的页边距的情况。这样过大的页边距不仅浪费了页面空间，而且在打印或电子阅读时也

2024-10-20 21:50:20

目录 1.引言 2.准备工作 3.基础理论知识 4.步骤详解 5.常见问题解答 6.成果案例分享 7.案例代码示例1.引言火柴人（Stick Figure）是一种极简风格的图形，通常由简单的线段和圆圈

2024-10-20 21:50:09

目录环境介绍类和函数区别封装性：状态保持：可重用性：继承和多态：设计模式：代码组织：执行流程：参数传递：返回值：上下文管理：总结环境window10，pyc

2024-10-20 21:50:03

目录一、JWT的介绍二、JWT的组成 1、Header（头部） 2、Payload（负载） 3、Signature（签名）三、Python写JWT 1、安装Jwt 2、使用JWT 3、解密JWT 总结一、JWT的介绍JW

2024-10-18 23:10:58

目录视频转换成 GIF 图形的重要性 1. 增强表达效果 2. 适应性强 3. 文件大小优化 4. 易于创建和编辑 5. 吸引用户注意力 6. 简化获取信息的步骤用python实现视gif

2024-10-18 23:10:46

目录前言 1. 构建分子式 2. 判断化合价 3. 解析分子式 4. 化合物反应方程式平衡 5. 化合物的摩尔质量计算 6. 计算化合物的质量分数 7. 计算反应热 8. 计算化合物的pH值总

2024-10-18 23:10:16

目录 1 创建 pytest.ini 文件 2 常见参数及配置方法 3 高级配置 4 结论1 创建 pytest.ini 文件在项目的根目录下，创建一个名为 pytest.ini 的文件即可。pytest 会在执行测试

2024-10-18 23:10:06

目录一、XPATH概念二、常用规则与方法 1.f12例子: 2.节点获取文本 3.属性匹配 4. 属性获取 5.iframe标签处理三、同级节点元素定位四、关键字定位五、定位

2024-10-18 23:09:49

目录引言发送GET请求获取页面的二进制数据添加查询参数发送POST请求处理JSON数据设置自定义Header 发送带认证信息的请求发送带有表单数据的请求发送带有文件的请

2024-10-18 23:09:30

安装CPU版本：(以2.9.0版本为例)pip install tensorflow==2.9.0安装GPU版本：(以2.9.0版本为例)pip install tensorflow-gpu==2.9.0若下载缓慢，使用阿里国内镜像源加速下载：(以2.9

2024-10-14 19:47:12

目录概述用asyncio实现Hello world 总结概述Python中 asyncio 模块内置了对异步IO的支持，用于处理异步IO；是Python 3.4版本引入的标准库。asyncio 的编程模型就是一个消息循

2024-10-14 19:47:02

目录 1. 问题描述 2. 解决办法 2.1 办法一：进入Script 进行安装 2.2 办法二：设置环境变量总结 1. 问题描述这几天一直用python实战，今天用pip想要安装一个库，结果突然报了

2024-10-14 19:46:53

目录实践环境问题域定义协议格式(编写proto文件) 编译协议缓冲区协议缓冲区 API 枚举标准消息方法解析和序列化编写消息读取消息另一个示例参考链接

2024-10-14 19:46:35

目录使用pip时报NameError: name‘pip’is not defined错误 1. 问题描述 2. 解决办法总结使用pip时报NameError: name‘pip’is not defined错

2024-10-14 19:46:27

目录 1. 概述 2. arange() 2.1 语法 2.2 参数 2.3 实例总结 1. 概述Numpy 中 arange() 主要是用于生成数组，具体用法如下；2. arange()2.1 语法numpy.arange(start, sto

2024-10-14 19:46:12

目录 1. 概述 2. vstack() 2.1 语法 2.2 参数 2.3 实例 3. hstack() 3.1 语法 3.2 参数 3.3 实例总结 1. 概述在Numpy中，最希望处理的数据就是数组和矩阵，下面就

2024-10-14 19:46:03

目录 Python列表简介 NumPy数组简介性能比较 1. 数组操作 2. 循环操作内存使用比较 1. 内存占用 2. 大数据集结论在Python中，处理数值数据时，我们通常面临两种选

2024-10-14 19:45:55

目录引言基础语法介绍核心概念基本语法规则基础实例问题描述代码示例进阶实例问题描述高级代码实例实战案例问题描述解决方案代码实现扩展

2024-10-14 19:45:46

目录引言 Python Excel库 Python 在Excel 中的添加数据条引言在Excel中添加数据条是一种数据可视化技巧，它通过条形图的形式在单元格内直观展示数值的大小，尤其适合比较同一

2024-10-14 19:45:37

目录

一、引言

二、什么是查询集？

2.1 创建查询集

三、查询集的延迟加载

3.1 查询集的惰性行为

2024-10-14 19:44:53

字符串问题我正在使用 python 通过 jdbc（或 odbc）访问 iris 数据库。我想将数据提取到 pandas 数据框中来操作数据并从中创建图表。我在使用 jdbc 时遇到了字符串处理问题。

2024-09-30 00:07:53

您的组织是否拥有太多 github 存储库，并且您需要一种简单的方法来总结和记录每个存储库的内容以用于报告、仪表板或审计目的？下面是一个使用 github api 完成该操作的快速脚本

2024-09-30 00:07:10

Python构建代理池构建有效的代理池对于爬虫任务至关重要，因为它可以绕过网站反爬或提升爬虫效率。在Python中构建代理池的方法如下：一、收集代理免费代理网站：如FreeProxyList

2024-09-18 16:06:35

&emsp;&emsp;本文介绍基于Python语言，针对一个文件夹下大量的Excel表格文件，对其中的每一个文件加以操作——将其中指定的若干列的数据部分都向上移动一行，并将所有

2024-09-09 23:42:47

技术背景一般情况下我们会选择使用明文形式来存储数据，如json、txt、csv等等。如果是需要压缩率较高的存储格式，还可以选择使用hdf5或者npz等格式。还有一种比较紧凑的数据存

2024-09-09 23:40:42

要将阿拉伯数字转换成中国汉字表示的数字，我们需要一个映射表来转换每个数字，并且处理不同位数的数字（如十、百、千、万等）。1. Python实现阿拉伯数字转换成中国汉字下面是一个

2024-09-09 23:40:16

目录一、问题描述二、问题解决一、问题描述笔者在使用opencv读取带有中文路径的图片时，发现会出现乱码的情况。具体问题如下：# 读取带有中文路径的图片出现错误import cv2img_

2024-08-28 10:54:27

2020-10-21

2021-03-02

2020-05-07

2020-05-26

2021-01-13

2021-04-02

2020-05-10

2020-05-09

2020-05-10

2020-10-21

新一代爬虫利器Python Playwright详解

目录

安装方式

特点

使用方式

代码生成

选择器

事件监听

总结

热点内容

免费资源网

在线工具

扫一扫随时看

本站下载频道