今晚十一点睡Python-程序员客栈

1月前来过

D级

软件测试工程师

全职 · 300/日 · 6525/月信用正常

工作时间: 工作日09:00-18:00、周末09:00-18:00工作地点: 远程

服务企业: 6家累计提交: 0工时

联系方式:

********

查看联系方式

聊一聊

使用APP扫码聊一聊

去下载APP

个人主页

1. 熟练使用xpath、re、json模块进行数据抓取2. 熟练使用MySQL数据库，熟悉Navicat、MongoDB等数据库3. 有充足的编程能力，了解计算机网络、数据结构，Http/Https协议4. 掌握常见的爬虫、反爬虫知识及应对措施；了解Linux系统5. 熟练掌握request库，Scrapy框架，了解scrapy-redis分布式组件6. 熟悉HTML、CSS、JavaScript等web前端技术

该用户选择隐藏工作经历信息，如需查看详细信息，可点击右上角“和TA聊一聊”查看

2017-09-12 - 2020-06-24上海开放大学计算机应用技术专科

Python

自动化测试

爬虫

作品

爬取ip代理

项目描述：Xml，redis，requests爬取代理ip，自己建造免费ip代理池（个人项目）项目功能：添加代理ip，定时判断已添加的代理是否能够使用，在其他项目中能够调用此api获取代理ip。项目职责： 1.使用requests爬取各个代理网站的免费ip。然后对于爬取数据的有效性，进行简单的测试。然后放入redis中而对于爬取的数据。由于不能出现重复的代理ip，其次，爬取的数据量较小，我使用redis数据库进行保存。对于重复的代理ip，使用redis中的set来进行去重。 2.对于存入redis中的代理ip，同时写了一个测试函数，主要对其中的代理ip进行数据定期的有效性的测试。以访问百度为测试为例，对于访问百度不通，代理无效的，从redis中删除数据 3.对于给外部调用此爬虫结果，我给此爬虫了一个接口return。用random的方式随机从爬取的数据中获取代理ip

2023-04-18 17:00

新闻分类资讯

项目描述：该项目主要爬取各网站新闻的热门，头条，时事热点等信息项目技能：scrapy_redis，Xpath，Redis，json 1.分析url地址，分析反爬策略，实现反反爬抓取数据。在下载中间键（Downloader）的_process_request方法中配置user-Agent和代理ip地址池，实现基本的反反爬策略。 2.由于爬取新闻网站多，爬取数据量大。数据请求url地址多，使用scrapy_redis来进行分布式爬取，由于redis非关系型数据库，读写更快，将请求的request对象保存到redis中。同时scrapy_redis能够实现去重持久化，请求对象持久化去重，实现分布式，能够有效提高爬虫效率 3.使用scrapy_redis的RFPDupeFilter方法来实现request对象的加密，使用sha1加密算法生成16位字符串指纹，在使用RedisPipline方法来进行数据的存储保存到redis前，查看redis中是否已经有相同的指纹，有就不保存。 4.爬取到的数据保存到MongoDB中，来实现数据的持久化。

2023-04-18 17:02

Spider Book

项目描述：爬取各个大型图书网站，如新华书店图书网，在线网上图书一号店等。获取它们图书的名称，简介，购买量，评论量，评论数据，价格等，存入数据库。项目技能： requests，Xpath，json，Redis，MongoDB，re 个人职责：1.使用requests模块，发送http请求，使用协程进行爬取网页，提高爬虫效率 2.分析需要爬取的数据，发现在ajax请求中，数据格式为json。使用re模块在返回的response.content中匹配需求数据，获取到数据 3.自定义get_ua函数，，调用get_ua随机获取user-agent，对request对象来进行包装，应对反爬 4.调用代理ip池，获取代理ip 5.使用MongoDB进行数据保存

2023-04-18 17:04

更新于: 2022-09-13 浏览: 193

个人介绍

工作经历和TA聊聊
APP扫码和程序员直接沟通

教育经历

技能

相似推荐换一批

重点城市程序员兼职推荐

重点岗位程序员兼职推荐