欢迎来到威聚
威扬盘搜

MediaCrawler

网络爬虫 Python 自定义免责声明(仅限技术学习,禁止商业/非法使用) Python 人工编写 推荐 ★5 中等

更新于 2026-09-08 15:52:48

项目简介

MediaCrawler 是一个功能强大的多平台自媒体数据采集工具,由 NanmiCoder 开发。它支持对小红书、抖音、快手、B站、微博、百度贴吧、知乎等主流内容平台的公开信息进行抓取,覆盖笔记/视频/帖子/问答及其评论、创作者主页等数据。

核心特性

  • 支持平台:小红书(笔记/评论)、抖音/快手/B站(视频/评论)、微博/贴吧(帖子/评论)、知乎(问答文章/评论)。
  • 采集模式:关键词搜索爬取、指定作品 ID 爬取、二级评论爬取、创作者主页爬取。
  • 登录态缓存:自动保存浏览器登录态与 Session Cookie,避免反复扫码。
  • IP 代理池支持,降低封禁风险。
  • 评论词云生成,便于舆情/热点分析。
  • 数据导出:CSV、JSON、JSONL、Excel、SQLite、MySQL 多种格式。

技术原理

项目通过 Playwright(或 Chrome DevTools Protocol / CDP 模式连接已安装的 Chrome >= v144)驱动浏览器,在保持登录态的上下文中执行 JS 表达式获取平台签名参数,从而规避复杂的 JS 逆向工程,并降低被风控的概率。提供基于 Vite 的前端 WebUI 与 Python(uvicorn)后端 API,支持可视化参数配置、实时日志查看与数据预览导出。

使用场景与建议

  • 适合做公开内容的数据分析、舆情监测、热点追踪等研究用途。
  • 二开建议:可基于现有平台适配器扩展新站点,或接入自有代理池与存储后端。
  • 注意:项目自带免责声明,仅限技术研究与学习,严禁任何商业或非法使用,使用者需自行承担法律责任;运行爬虫可能违反目标平台服务条款,账号/IP 可能被封禁。

按更新时间依次阅读