《Python网络数据采集》【PDF】_藏书者

http://blog.sina.com.cn/u/3283485963

首页博文目录关于我

个人资料

微博

加好友发纸条

写留言加关注

博客等级：
博客积分：

博客访问：
关注人气：
获赠金笔：0支
赠出金笔：0支
荣誉徽章：

正文字体大小：大中小

《Python网络数据采集》【PDF】

(2017-11-04 17:09:00)

标签：

数据时代技能书单

python网络数据采集

python

pdf

电子书

分类：大数据与人工智能

内容简介

本书采用简洁强大的Python语言，介绍了网络数据采集，并为采集新式网络中的各种数据类型提供了全面的指导。第1部分重点介绍网络数据采集的基本原理：如何用Python从网络服务器请求信息，如何对服务器的响应进行基本处理，以及如何以自动化手段与网站进行交互。第二部分介绍如何用网络爬虫测试网站，自动化处理，以及如何通过更多的方式接入网络。

译者序 ix

前言 xi

第一部分　创建爬虫

第1章　初见网络爬虫 2

1.1　网络连接 2

1.2　BeautifulSoup简介 4

1.2.1　安装BeautifulSoup 5

1.2.2　运行BeautifulSoup 7

1.2.3　可靠的网络连接 8

第2章　复杂HTML解析 11

2.1　不是一直都要用锤子 11

2.2　再端一碗BeautifulSoup 12

2.2.1　BeautifulSoup的find()和findAll() 13

2.2.2　其他BeautifulSoup对象 15

2.2.3　导航树 16

2.3　正则表达式 19

2.4　正则表达式和BeautifulSoup 23

2.5　获取属性 24

2.6　Lambda表达式 24

2.7　超越BeautifulSoup 25

第3 章　开始采集 26

3.1　遍历单个域名 26

3.2　采集整个网站 30

3.3　通过互联网采集 34

3.4　用Scrapy 采集 38

第4 章　使用API 42

4.1　API 概述 43

4.2　API 通用规则 43

4.2.1　方法 44

4.2.2　验证 44

4.3　服务器响应 45

4.4　Echo Nest 46

4.5　Twitter API 48

4.5.1　开始 48

4.5.2　几个示例 50

4.6　Google API 52

4.6.1　开始 52

4.6.2　几个示例 53

4.7　解析JSON 数据 55

4.8　回到主题 56

4.9　再说一点API 60

第5 章　存储数据 61

5.1　媒体文件 61

5.2　把数据存储到CSV 64

5.3　MySQL 65

5.3.1　安装MySQL 66

5.3.2　基本命令 68

5.3.3　与Python 整合 71

5.3.4　数据库技术与最佳实践 74

5.3.5　MySQL 里的“六度空间游戏” 75

5.4　Email 77

第6 章　读取文档 80

6.1　文档编码 80

6.2　纯文本 81

6.3　CSV 85

6.4　PDF 87

6.5　微软Word 和.docx 88

第二部分　高级数据采集

第7 章　数据清洗 94

7.1　编写代码清洗数据 94

7.2　数据存储后再清洗 98

第8 章　自然语言处理 103

8.1　概括数据 104

8.2　马尔可夫模型 106

8.3　自然语言工具包 112

8.3.1　安装与设置 112

8.3.2　用NLTK 做统计分析 113

8.3.3　用NLTK 做词性分析 115

8.4　其他资源 119

...

下载地址：https://u3990681.ctfile.com/fs/3990681-227047794

阅读┊ 收藏 ┊ 喜欢 ▼ ┊打印┊举报/Report

前一篇：《数据科学入门》【PDF】

后一篇：《决策知识自动化》【PDF】

新浪BLOG意见反馈留言板　欢迎批评指正