MediaCrawler
更新于 2026-09-08 15:52:48
项目简介
MediaCrawler 是一个功能强大的多平台自媒体数据采集工具,由 NanmiCoder 开发。它支持对小红书、抖音、快手、B站、微博、百度贴吧、知乎等主流内容平台的公开信息进行抓取,覆盖笔记/视频/帖子/问答及其评论、创作者主页等数据。
核心特性
- 支持平台:小红书(笔记/评论)、抖音/快手/B站(视频/评论)、微博/贴吧(帖子/评论)、知乎(问答文章/评论)。
- 采集模式:关键词搜索爬取、指定作品 ID 爬取、二级评论爬取、创作者主页爬取。
- 登录态缓存:自动保存浏览器登录态与 Session Cookie,避免反复扫码。
- IP 代理池支持,降低封禁风险。
- 评论词云生成,便于舆情/热点分析。
- 数据导出:CSV、JSON、JSONL、Excel、SQLite、MySQL 多种格式。
技术原理
项目通过 Playwright(或 Chrome DevTools Protocol / CDP 模式连接已安装的 Chrome >= v144)驱动浏览器,在保持登录态的上下文中执行 JS 表达式获取平台签名参数,从而规避复杂的 JS 逆向工程,并降低被风控的概率。提供基于 Vite 的前端 WebUI 与 Python(uvicorn)后端 API,支持可视化参数配置、实时日志查看与数据预览导出。
使用场景与建议
- 适合做公开内容的数据分析、舆情监测、热点追踪等研究用途。
- 二开建议:可基于现有平台适配器扩展新站点,或接入自有代理池与存储后端。
- 注意:项目自带免责声明,仅限技术研究与学习,严禁任何商业或非法使用,使用者需自行承担法律责任;运行爬虫可能违反目标平台服务条款,账号/IP 可能被封禁。