当前位置:
首页 >
豆瓣评论【数据集分享】
发布时间:2024/8/1
77
豆豆
生活随笔
收集整理的这篇文章主要介绍了
豆瓣评论【数据集分享】
小编觉得挺不错的,现在分享给大家,帮大家做个参考.
相信很多做自然语言处理、数据分析的小伙伴们都接触过豆瓣评论数据集。
最近 《脱口秀大会5》 比较火,所以我就抓去了一份《脱5》的豆瓣短评数据集,样例如下表所示:
{"comment_time": "2022-11-02 22:37:41", "comment_score": "很差", "comment_vote": "21", "comment_content": "\"不敢说所有,至少有一部分人初心变了。不好笑不要赖观众,心思都放在稿子和段子上了吗,那广告接得,秀走得,不好笑也正常啊。\"", "comment_username": "江湖谝子" }- 其中,comment_score表示豆瓣评分,总共五颗星,对应总分为 10分。每一颗星对应2分。
不同星数对应的中文描述为:
- comment_vote 代表的是有多少人赞同这条短评。
其实,豆瓣网站有严格的数据获取限制,用户仅仅能访问最热门的短评数据集共计 600 条。然后再进行翻页,网站系统则会禁止。
同时豆瓣也仅提供 200 条最新的短评。根据这些数据,我做了一个加权统计,《脱5》的豆瓣加权平均分仅仅有3.3分。口碑大大滑坡。
我还对《脱5》的豆瓣评论做了详细的数据分析,感兴趣可以看看。数据集以 json 格式给出。有需要的小伙伴可以关注下面公众号自取。
步骤如下:
- 1 关注微信gong—zhong号JioNLP
- 2 回复【脱口秀大会5】获取下载链接
- 3 该数据集是免费的
如何在程序中加载
如果有编程经验,可以用python进行操作
- 1 安装 jionlp 工具包
- 2 编写以下代码执行
数据将定期更新,未来也会根据国务院的行政区划调整进行重新抓取。
我已经把数据集公开出来,可以扫码关注微信gong—zong号JioNLP,回复脱口秀大会5获取。
JioNLP 是一个专注挖掘并分析互联网数据的gong—zhong号,还想要什么数据集?来看看这里有没有你想要的数据吧。
本文由mdnice多平台发布
本文由mdnice多平台发布
总结
以上是生活随笔为你收集整理的豆瓣评论【数据集分享】的全部内容,希望文章能够帮你解决所遇到的问题。
- 上一篇: linux下vi命令大全
- 下一篇: jad反转换文件