《旅游大数据》
实验指导书
刘小燕
实验项目一 绘制国内旅游提升计划(2023-2025年)的词云图
【实验目的】
熟悉python软件的使用,学会绘制词云图
【实验内容】
学会将相关的政策文件下载,并转换为txt格式文件,再利用python软件绘制相关文本的词云图,并学会分析词云图。
【实验环境】
Anaconda-Jupyternotebook/Python。
【实验步骤】
importchardet
importjieba
fromwordcloud import WordCloud
#自动检测编码并读取文件内容
defread_text_file(file_path):
withopen(file_path, "rb") as f: # 以二进制模式打开
raw_data= f.read()
encoding= chardet.detect(raw_data)['encoding'] # 自动检测编码
returnraw_data.decode(encoding) # 解码文件内容
#读取文本文件
file_path= "/Users/nathan/Desktop/十四五文化和旅游发展规划.txt"
text= read_text_file(file_path)
#使用jieba进行中文分词
ls= jieba.lcut(text)
cut_text= " ".join(ls)
#定义停用词
stopwords= set() # 假设你有一个停用词列表,可以在这里填充
#例如:stopwords.update(['的','是','在','有','和'])
#创建词云对象
cloud= WordCloud(
font_path="/System/Library/Fonts/PingFang.ttc", # 设置字体路径
stopwords=stopwords,
width=1000,
height=700,
background_color="white", # 可以设置背景颜色
)
#生成词云
wordcloud= cloud.generate(cut_text)
#保存词云图像
output_path= '/Users/nathan/Desktop/十四五文化和旅游发展规划.jpg'
wordcloud.to_file(output_path)
#显示词云图像(可选)
image_p= wordcloud.to_image()
image_p.show()
实验项目二 使用Python生成词云图并进行对比分析
【实验目的】
能够通过绘制多个词云图实现对比分析,并撰写分析报告
【实验内容】
正确使用Python生成23年和24年的词云图,停词表使用,对两个词云图进行有效对比,并提供分析报告。
【实验环境】
Anaconda-Jupyternotebook/Python。
【实验步骤】
数据资料网址链接:https://www.hubei.gov.cn/zwgk/hbyw/hbywqb/202402/t20240208_5081748.shtml
实验步骤1:生成23年总结的词云图
实验步骤2:生成24年展望的词云图
实验步骤3:实现简单的停词
实验步骤4:对比分析两个词云图,并写一段简单的分析
实验项目三 爬取携程某一景点评论数据并提交分词及词频统计结果(OTA评论数据爬取)
【实验目的】
运用Python对典型旅游网站中的UGC内容进行爬取。
【实验内容】
数据爬取:成功爬取携程景点评论数据;数据清洗:对爬取的数据进行有效清洗;分词及词频统计。
【实验环境】
Anaconda-Jupyternotebook/Python。
【实验步骤】

实验项目四 利用停用词表生成词云并进行表述性分析
【实验目的】
运用Python对典型旅游网站中的UGC内容进行爬取。
【实验内容】
学会根据现有的OTA中的UGC数据,生成词云图并描述词云图结果。
【实验环境】
Anaconda-Jupyternotebook/Python。
【实验步骤】
导入停用词,生成词云图。
本实验延伸;可以尝试修改停用词表,观察词云图的变化。尝试使用不同的字体,比如SimSun(宋体)或STHeiti(华文黑体)。探索其他词云图生成参数,如颜色、形状等。
实验项目五 爬取去哪儿目的地景点数据并提交加权处理后的推荐结果
【实验目的】
学会基于UGC大数据的爬取来规划/推荐旅游路线。
【实验内容】
成功爬取去哪儿目的地景点数据;对数据进行合理的加权处理;根据加权处理结果生成推荐列表。
【实验环境】
Anaconda-Jupyternotebook/Python。
【实验步骤】







