导语:
本文主要介绍了关于python数据模块类如何定义的相关知识,包括日常办公会用到的python模块,以及python模块导入这些编程知识,希望对大家有参考作用。
说明
1、定义数据模块类,名为DataLoader。
2、类中有一个核心变量data用于保存爬取数据,以及两个相关接口grab_data(爬取数据)和save_data(本地保存数据)。
实例
grab_data() 的核心代码
def grab_data(self):
# 获取入口链接
entries = self.get_entry()
# 遍历入口链接,解析得到文章链接
links = self.parse4links(entries)
# 遍历文章链接,解析得到文章内容
datas = self.parse4datas(links)
# 将相关数据写入变量 data
self.data = pd.DataFrame(datas)
save_data() 的核心代码
def save_data(self):
# 将变量 data 写入 csv 文件
self.data.to_csv(self.data_path, index = None)
我们已经爬取并保存了data数据,数据以DataFrame的形式存储,保存在csv文件中,格式如下:
|---------------------------------------------------|
| id | link | cont | title |
|---------------------------------------------------|
| page id | page link | page content | page title |
|---------------------------------------------------|
| ...... | ...... | ...... | ...... |
|---------------------------------------------------|
本文教程操作环境:windows7系统、Python 3.9.1,DELL G3电脑。
本文为原创文章,版权归知行编程网所有,欢迎分享本文,转载请保留出处!
你可能也喜欢
- ♥ python单元测试有什么好处?01/11
- ♥ python中的xlrd库是如何实现文件读取的?01/08
- ♥ 如何在python中分解素数?08/19
- ♥ Python bs4的四个对象12/12
- ♥ 初学者必须知道的Python3文件操作12/22
- ♥ 如何在python中颠倒顺序08/31
内容反馈