【Python爬虫】120行代码爬取豆瓣电影,附源码
学习爬虫 , 拿豆瓣电影进行练手 , 无奈豆瓣电影存在反爬机制 , 爬完250就会重定向要求我进行登陆操作 , 所以我这一次只爬取前50进行相关测试 , 废话不多说 , 我们来看下源代码:
import requests
from bs4 import BeautifulSoup
import re
import pandas
headers = {
'Host':'movie.douban.com'
'Origin':'movie.douban.com'
'User-Agent':'Mozilla/5.0 (Linux; Android 6.0; Nexus 5 Build/MRA58N) AppleWebKit/537.36 (KHTML like Gecko) Chrome/73.0.3683.103 Mobile Safari/537.36'
base_url = 'https://movie.douban.com/top250?start={&filter='
response = requests.get('https://movie.douban.com/top250?start=0&filter=' headers = headers)
if response.status_code == 200:
# print(response.text)
pass
pattern1 = re.compile('<div.*?class=\"item\">.*?<div.*?class=\"pic\">.*?<a.*?href=https://mparticle.uc.cn/"(.*?)\">' re.S) # 去掉所有换行符 , 并用正则表达式去匹配每一个页面的具体电影
推荐阅读
- Python|阿里达摩院13小时讲完的python!整整466集,拿走不谢
- 爬虫学习之HttpClient练习
- Python打开和关闭文件
- 爬虫学习之HTTP协议初步了解
- 用python爬了840款真无线蓝牙耳机数据,竟发现了几个有趣结论!
- 手把手教你使用Python操控手机微信app(最新教程)
- Python编程常用技巧,你全知道么?
- 升职加薪利器:Python+Pytest框架在Jenkins上生成Allure测试报告
- 编程零基础应当如何开始学习 Python?
- 女神照片当背景,使用Python做个免费的VIP视频播放软件