欢迎访问 生活随笔!

生活随笔

当前位置: 首页 >

豆瓣评论【数据集分享】

发布时间:2024/8/1 77 豆豆
生活随笔 收集整理的这篇文章主要介绍了 豆瓣评论【数据集分享】 小编觉得挺不错的,现在分享给大家,帮大家做个参考.

相信很多做自然语言处理、数据分析的小伙伴们都接触过豆瓣评论数据集

最近 《脱口秀大会5》 比较火,所以我就抓去了一份《脱5》的豆瓣短评数据集,样例如下表所示:

{"comment_time": "2022-11-02 22:37:41", "comment_score": "很差", "comment_vote": "21", "comment_content": "\"不敢说所有,至少有一部分人初心变了。不好笑不要赖观众,心思都放在稿子和段子上了吗,那广告接得,秀走得,不好笑也正常啊。\"", "comment_username": "江湖谝子" }
  • 其中,comment_score表示豆瓣评分,总共五颗星,对应总分为 10分。每一颗星对应2分。
    不同星数对应的中文描述为:
{'力荐': 5, '推荐': 4, '还行': 3, '较差': 2, '很差': 1 }
  • comment_vote 代表的是有多少人赞同这条短评。

其实,豆瓣网站有严格的数据获取限制,用户仅仅能访问最热门的短评数据集共计 600 条。然后再进行翻页,网站系统则会禁止。

同时豆瓣也仅提供 200 条最新的短评。根据这些数据,我做了一个加权统计,《脱5》的豆瓣加权平均分仅仅有3.3分。口碑大大滑坡。

我还对《脱5》的豆瓣评论做了详细的数据分析,感兴趣可以看看。数据集以 json 格式给出。有需要的小伙伴可以关注下面公众号自取。

步骤如下:

  • 1 关注微信gong—zhong号JioNLP
  • 2 回复【脱口秀大会5】获取下载链接
  • 3 该数据集是免费的

如何在程序中加载

如果有编程经验,可以用python进行操作

  • 1 安装 jionlp 工具包
$ pip install jionlp
  • 2 编写以下代码执行
import jionlp as jio comment_list = jio.read_file_by_line(/path/to/short_comment_has_watched_highest_tuokouxiudahui5.txt) # 解压后替换为下载路径

数据将定期更新,未来也会根据国务院的行政区划调整进行重新抓取。

我已经把数据集公开出来,可以扫码关注微信gong—zong号JioNLP,回复脱口秀大会5获取。

JioNLP 是一个专注挖掘并分析互联网数据的gong—zhong号,还想要什么数据集?来看看这里有没有你想要的数据吧。

本文由mdnice多平台发布

本文由mdnice多平台发布

总结

以上是生活随笔为你收集整理的豆瓣评论【数据集分享】的全部内容,希望文章能够帮你解决所遇到的问题。

如果觉得生活随笔网站内容还不错,欢迎将生活随笔推荐给好友。