400105041《数据采集与网络爬虫》实验课程教学大纲(单设)

发布者:admin发布时间:2024-07-24浏览次数:11


数据采集与网络爬虫》实验课程教学大纲

  1. 课程基本信息

    课程名称

    数据采集与网络爬虫

    课程代码

    400105041

    课程英文名称

    Data acquisition and Web Crawler

    课程性质

    必修实验环节

    学分/学时

    1.5/30

    实验/课程设计

    实验

    考核方式

    考核

    先修课程

    Python程序设计

    开课院系

    商学院物流与大数据管理系

    适用专业

    大数据管理与应用

    编写人

    邓国华、官淑琪

    审核人

    陈星光

    实验课程指导书


  2. 课程简介

《数据采集与网络爬虫》单设实践环节面向大数据管理与应用专业本科生,课程目的在于使学生学习互联网大数据采集工具及网络爬虫的基本技术,并结合相关数据采集工具和Python编程进行实现,通过实验,使学生对互联网大数据采集技术有一个全面的了解,掌握基本的互联网信息内容采集、提取和分析方法,并且具备一定的针对具体信息采集需求的实际运用和解决能力;同时通过实验提高学生分析和解决问题的能力,培养学生严谨的工作作风和实事求是的工作态度,使学生掌握互联网数据采集的方法,提高解决实际数据采集问题、动手编程与操作的实践能力,为学习后继课程和未来的研究及实际工作打下良好的基础。

(英文简介)

DataAcquisition and Web Crawler is a single practice for undergraduatesmajoring in big data management and application. The purpose of thecourse is to enable students to learn the basic technologies of bigdata collection tools and web crawler on the Internet, and to realizeit with related data collection tools and Python programming. Throughthe experiment, students can have a comprehensive understanding ofbig data collection technology on the Internet, and master the basiccontent collection of Internet information. Extraction and analysismethods, and have a certain practical application and solutioncapabilities for specific information collection needs; At the sametime, it improves students'ability to analyze and solve problemsthrough experiments, fosters students' rigorous working style andrealistic working attitude, enables students to master the methods ofdata collection on the Internet, improves the practical ability ofsolving the actual data collection problems, programming andoperation, and lays a good foundation for subsequent courses andfuture research and practical work.

  1. 课程目标

课程目标1—掌握基本的互联网信息内容采集和提取的基本原理和方法;

课程目标2—掌握利用Python编程完成静态网页数据、动态网页数据等典型数据采集场景实验;

课程目标3—掌握利用八爪鱼工具完成静态网页数据、动态网页数据等典型数据采集场景实验;

课程目标4—能利用Python编程或八爪鱼等爬虫工具解决实际数据采集任务。

课程目标与毕业要求的对应关系

本课程目标与毕业要求指标点的对应关系如下表所示:

毕业要求及指标点

课程

目标1

课程

目标2

课程

目标3

课程

目标4

毕业要求1

指标点1.2:掌握本专业相关的经济学、管理学、数据科学、信息技术基本理论和基本知识。




毕业要求2

指标点2.1:具有批判性和创造性思维,具备发现数据管理、数据运营管理与决策分析、大数据分析与应用、信息化和数字化建设等相关专业领域问题的敏锐性和判断力,并根据需要优化设计程序和解决方案。


毕业要求3

指标点3.1:能够使用专业先进技术和信息技术工具。


毕业要求4

指标点3.2:能够使用计算机和统计分析软件对数据进行综合分析并发现规律,为专业决策提供依据。


  1. 内容安排

    实验项目编号

    实验项目名称

    实验 教 学 主 要 内 容

    实验项目学时

    课程目标

    教学方式

    考核方式

    实验

    要求

    实验

    类别

    实验

    类型

    是否为虚拟仿真教学项目

    1

    Python静态网页数据采集

    1.1网络爬虫的基本原理

    1.1Xpath基本操作

    1.2BeautifulSoup基本操作

    1.3静态数据采集示例(Talkenglish网站、豆瓣电影、彼岸桌面、ChinaDaily

    10

    课程目标12

    实验演示、任务驱动

    实验作业、期末考核实验报告

    专业基础


    综合性

    2

    Python动态网页数据采集

    2.1动态网页数据采集基本方法

    2.2动态网页数据采集示例(51job、淘宝、京东评论、腾讯视频弹幕)

    10

    课程目标13

    实验演示、任务驱动

    实验作业、期末考核实验报告

    专业

    综合性实验

    综合性

    3

    八爪鱼数据采集

    3.1搜狗微信内容采集

    3.2电商网址商品信息采集

    10

    课程目标14

    实验演示、任务驱动

    实验作业、期末考核实验报告

    专业基础

    综合性实验

    综合性

    注:

    实验项目编号:为课程代码+3位序号+*


    实验要求:必修、选修、其它。


    实验类别:基础、专业基础、专业。


    实验类型:演示性、验证性、综合性、设计创新性等。


    教学方式:讲授法、演示示范、案例分析、研讨式、混合式、其它。


    考核方式:实验报告、课堂互动、分析论文、课程设计、考试、其它。

  2. 实验主要仪器设备

    实验项目编号

    实验项目名称

    主要仪器设备

    及台(套)数

    实验材料

    备注

    01

    所有实验项目

    90

    计算机

    或自带笔记本电脑

  3. 实验指导书具体要求

1)基本要求

实践环节应充分体现“教师指导下的以学生为中心”的教学模式,以学生为认知主体,充分调动学生的积极性和能动性,重视学生自学能力的培养,把理论与实践相结合,提高其实际动手能力和创新能力。以小组为单位,引导学生理论联系实际,综合运用所学的Python程序设计、网络爬虫等相关知识,完成静态网页数据、动态网页数据、带登录网页数据等典型数据采集场景实验。成果以网络爬虫案例报告展示以及文档的形式提交。

2)实验内容

全班分为若干小组,每小组34人。完成静态网页数据、动态网页数据、带登录网页数据、Scrapy爬虫框架等典型数据采集场景实验。其具体要求如下所示:

1)个人任务:

根据网络爬虫的原理和基本流程,利用网络爬虫工具和Python编程,认真完成数据采集实验任务,并撰写实验报告。

2)小组任务:

各小组自由选择数据采集源(要求动态网页和静态网页各一个),按照数据采集与网络爬虫的流程步骤,完成网页数据连接信息采集、数据内容采集、文本分词和词云分析等基本的文本数据分析。并按照数据采集与网络爬虫各环节撰写相应的实验报告,最后提交详细的数据采集分析报告和源程序。

3)实验步骤

主要实验步骤如下:

利用工具软件进行数据采集:熟悉八爪鱼等工具进行互联网数据采集。

利用Python编程完成网页数据采集:

1)网页特征分析:查看网页源码,分析需要采集数据为静态网页数据还是通过AJAX动态加载的数据,如果为动态加载的数据,通过开发者工具查找动态数据的源链接地址。

2)实现HTTP请求:使用Requests库实现向数据源网址发送GET请求。包括对请求头部信息headers、超时时间Timeout、缓存cookies等参数的设置;

3)解析网页:根据网页的特点,选择XpathBeautifulSoup库、正则表达式等方法对网页进行解析,按需提取数据信息;

4)数据存储:将抓取的数据存储到txtcsv文件中;

5)对文本数据进行词频分析和词云制作等简单的文本分析;

6)利用八爪鱼软件完成搜狗微信和电商网址商品信息的采集。

4)完成实验报告

按照数据采集与网络爬虫各环节撰写相应的实验报告,提交详细的数据采集分析报告和源程序。

  1. 课程成绩评定

课程成绩可由过程考核成绩和课程结业考试成绩两大部分组成,权重可以按课程自身特点进行设置,无故旷课,累计时间超过课程学时数的1/3或实验报告完成量少于规定的2/3者,课程成绩为不及格。

(一)过程考核成绩包括实验预习、实验操作、实验报告及教学过程的参与度与学习态度等,以下内容可以根据实际情况进行增删调整。

1.内容分解

序号

观测点(权重)

细化的观测点

权重

得分

分项得分

1

实验预习

0.2

课堂提问对实验目的,内容及原理的熟悉程度

1.0



2

实验实施

0.5

实验态度及参与程度

0.5



操作技能

0.3


协作精神

0.2


3

实验报告

0.3

实验报告撰写质量

0.3



Python网络爬虫部分实验完成情况

0.3


八爪鱼网络爬虫部分实验完成情况

0.4


合计:



2.评分标准

序号

观测点(权重)

细化的观测点

优秀标准

良好标准

合格标准

不合格标准

1

实验预习

0.2

课堂提问对实验目的,内容及原理的熟悉程度

问题回答完整准确,对实验目的和实验内容有明确了解和掌握,实验方案有创新

基本准确回答预习问题,对实验目的和实验内容有明确了解和掌握,掌握可行的实验方案

对实验目的和实验内容基本了解,不能很好的回答预习问题

几乎没有进行实验预习,对实验目的和实验内容不了解,未能回答预习问题

2

实验实施

0.5

实验态度及参与程度

按时参加实验,具有较强的主观能动性,勤于提问,积极思考

按时参加实验,具有一定的主观能动性,勤于提问

按时参加实验,需在指导和督促下开展基本实验

实验迟到,被动参与实验,实验过程不深入仔细,实验大部分时间做与实验内容无关的事情

操作技能

实验过程熟练,操作规范,动手能力强,方案实施正确合理,进展顺利

实验过程较熟练,能完成基本操作,方案实施顺利

可在指导下完成实验操作,能解决方案实施过程中出现的问题

未完成基本实验操作

协作精神

推进团队计划实施,主动组号分配任务,并能协调同组成员

推进团队计划实施,完成分配任务,能与小组成员配合

实验实施困难与问题较多,团队协作体现不足

被动参与实验吗,未完成团队协作所要求的内容

3

实验报告

0.3

实验报告撰写质量

实验报告撰写及实验过程规范;数据采集和爬虫的思路清晰;抓取信息结果完整,很好地掌握了网络爬虫的基本原理及Python实现和爬虫工具软件的使用。

实验报告撰写及实验过程较规范;数据采集和爬虫的思路较清晰;较好地掌握了网络爬虫的基本原理及Python实现和爬虫工具软件的使用。

实验报告结构完整、规范化不足;实验整体完成质量一般

实验报告不完整,部分思路较为混乱,爬取数据不符合网页信息;部分实验内容没有完成。


  1. 课程结业考试可以采用试卷笔答、实验综合实操或课程设计等方式,需要详细说明考核方式的组织形式、考核内容、达成目标及评分标准。

1)课程结业考试形式:

采取“实验综合实操”

2)考核要求:

要求学生根据考核题目的要求,21小组完成实操任务,并提交实验报告。

3)考核内容:

注:以上面考核内容为参考,实际考核内容根据学生掌握情况进行适当调整。

4)评分标准:

评分标准参考(一)中实验报告评分标准。


  1. 参考资料

1.明日科技.Python网络爬虫从入门到实践.吉林大学出版社.2020.9

2.曾剑平.Python爬虫大数据采集与挖掘.清华大学出版社.2020.3

3.江吉彬,张良均.Python网络爬虫技术.人民邮电出版社.2019.4.


执笔团队(人):邓国华、官淑琪          审核人:陈星光