零代码爬取1127条《牛来》影评!我用豆包工作跑完了从爬虫到分析全流程
不会Python,能爬取豆瓣影评并做情感分析吗?我试了一下,答案是可以。全程用豆包工作(AI编程助手),靠几条精准的提示词,就完成了《牛来》豆瓣全部长评的爬取、清洗、情感分析和主题挖掘,一共 1127条数据。

这篇文章把完整实操链路拆给你看,包括中间踩过的坑和关键提示词的写法。看完你也能复现。
找准目标页面,摸清URL规律
先打开豆瓣《牛来》的影评主页,地址是:
https://movie.douban.com/subject/38581618/reviews

图:豆瓣《牛来》影评主页,共1152条长评
往后翻几页,你会发现URL很有规律:
- 基础URL不变,就是上面那个地址
- 分页参数是 ?sort=hotest&start={n}
- 每页20条,n从0开始,每次加20(0、20、40……)
这个规律很重要,后面写提示词时要告诉AI,让它自动遍历所有分页,而不是只爬前几页。

图:豆瓣影评分页,共1168条,分页参数start按20递增
Playwright方案提示词拆解
本节用到的AI工具是豆包工作,没有下载豆包工作的同学可以去官网下载安装。

图:豆包工作官网下载页
打开豆包工作,选择「本地电脑」模式,新建项目。

图:选择「工作任务·本地电脑」模式,新建项目
第一次我直接让AI写爬虫,用的是requests方案,结果跑起来就被豆瓣反爬拦住了,豆瓣对纯HTTP请求有算力验证和IP封禁,纯请求方案根本不通。

图:AI编写爬虫脚本,遇到豆瓣PoW算力验证反爬拦截
关键转变:改用 Playwright 模拟真实浏览器。修改提示词后,一次就跑通了。下面是这条提示词的核心要素,每一个都不能少:
角色设定:精通Playwright浏览器自动化与反反爬的数据工程师。
技术方案(强制):必须用Playwright + Chromium真实浏览器,禁止用requests/httpx。浏览器用headless=False(非无头),视口1920×1080,启动时注入豆瓣登录Cookie(关键是dbcl2这个cookie)。
页面结构与提取要点:
- 评论条目:div.review-item
- 评分:span.allstar{10|20|30|40|50},末尾数字除以10转成1-5分
- 完整正文:点击"展开"后内容在div.full-content里,div.short-content永远是截断版,必须读full-content
- 有用数:a.action-btn.up里的数字
展开操作(关键避坑):展开按钮必须用 btn.evaluate("el => el.click()") 通过JS点击,不能用btn.click(),后者会等元素可见,部分按钮隐藏时会超时30秒拖死爬虫。每点一个间隔0.3-0.8秒,全部点完后等5秒确保AJAX内容加载完。
末页判断(关键避坑):第一页就读取页面显示的总评论数(如"全部1152条"),据此算总页数。 不能用"本页不足20条"判断末页——懒加载没完成时经常不足20条,会导致提前终止。
反爬与稳定性:每页间隔8-15秒随机延迟;遇到 http://sec.douban.com验证页就退避重试(首次等30秒,逐次翻倍,最多5次);每爬完一页即时写入文件,中断后能从断点续跑。
输出:存成CSV(UTF-8-BOM,Excel能直接打开)和JSON两种格式,爬完输出统计信息。
就这条提示词,AI自动生成了完整的Python脚本,跑了大约40分钟,1127条评论全部抓下来了。

图:爬取完成!共1136条,覆盖率98.4%,覆盖第1-58页全部,内容完整度100%
一条提示词搞定数据分析
数据爬完后,换个角色提示词,让AI做分析。这条提示词的核心要素:
角色设定:专业的中文文本分析师与电影评论研究者,擅长情感分析、主题挖掘和数据可视化。
分析步骤(按顺序执行):
数据清洗:按评论ID和正文双重去重,剔除少于10字、纯表情、与电影无关的评论,输出清洗前后对比
情感分析:每条评论分正面/中性/负面,用"评星权重0.6 + 文本情感权重0.4"的综合模型,输出整体分布和时间趋势
关键词提取:全量高频词Top30、正面高频词Top20、负面高频词Top20
主题分类:按剧情、演员、导演、画面、音乐、节奏、主题、角色、结尾9个维度多标签分类,计算各主题提及率和满意度
综合结论:最满意Top5、最不满意Top5、核心争议点、改进建议,每点附高赞评论原文
输出要求:中文结构化报告,数据表格化,情感分布和主题满意度用图表呈现,所有结论标注样本量。
AI读取CSV文件后,自动完成了全部分析,生成了完整报告。下面是核心结论。

图:分析完成,数据清洗后1127条,情感分布正面62.6%、中性18.5%、负面18.8%
数据结论:电影争议在哪
评分呈U型分布。有评分的评论平均3.73/5,但5星和1星加起来占了77.5%,中间评分很少。情感分析正面占62.6%,负面占18.8%——看完的人几乎不会觉得"一般般",要么被打动,要么被劝退。

图:情感分布饼图
评分分布统计(5星416条36.7%,1星160条14.1%,未评分382条33.9%)

图:评分分布柱状图(U型分布)

图:情感时间趋势(正面/负面占比 + 日评论数)
最满意的三个点:角色塑造(满意度76.2,牛来成长线+牛妈牺牲被夸最多)、音乐和片尾曲(73.2,《雨后轻风有香》和苏联风格配乐成了最大惊喜)、主题立意(71.5,大量"牛学"深度解读)。

图:正面 vs 负面评论高频词对比
最不满意的三个点:制作粗糙("粗糙"一词出现899次,画面建模动画流畅度是硬伤)、节奏拖沓水时长(满意度最低70.1,大量空镜头和超长反应镜头)、剧情逻辑混乱(角色降智、关键情节靠"刷新"推进)。

图:各主题满意度排名
最有意思的发现:5星评论里藏着不少"反讽式好评",表面夸上天实际在讽刺;而一些1星评论正文反而承认影片有诚意。光看星级根本判断不了真实态度。另外"票房"一词出现838次,不少人质疑融资骗钱甚至洗黑钱,但也有人认为母子二人5年自费制作值得谅解。
总结
回顾整个流程,其实就三步:
- 摸清目标网站的URL规律和页面结构
- 用精准提示词让AI生成Playwright爬虫脚本(重点写清技术方案、CSS选择器、避坑点)
- 再换一条提示词让AI完成数据分析(重点写清分析步骤和输出格式)
全程没有手写一行代码,所有脚本都是AI生成的。关键在于提示词要写得足够具体,角色、任务、技术约束、页面结构、避坑点、输出格式,缺一不可。提示词越精准,AI翻车的概率越低。感兴趣的同学可以上手试试。
更多推荐




所有评论(0)