Crawl4ai专为LLM而生的爬虫
做 AI 应用的人,迟早都会撞上同一个问题–喂给模型的数据从哪来?
模型自己不会上网。你要给它知识,就得先去网上抓内容、清洗、转成它能吃的格式。而网页抓取这件事,从来都不简单:动态加载、反爬、登录态、表格、分页、JS 渲染……每个都是坑。
有人专门为 LLM 场景做了一个爬虫,把抓取到的网页直接转成干净的 Markdown。这个项目叫 crawl4ai,是 GitHub 上 star 最多的爬虫,作者是 unclecode。
做 AI 应用的人,迟早都会撞上同一个问题–喂给模型的数据从哪来?
模型自己不会上网。你要给它知识,就得先去网上抓内容、清洗、转成它能吃的格式。而网页抓取这件事,从来都不简单:动态加载、反爬、登录态、表格、分页、JS 渲染……每个都是坑。
有人专门为 LLM 场景做了一个爬虫,把抓取到的网页直接转成干净的 Markdown。这个项目叫 crawl4ai,是 GitHub 上 star 最多的爬虫,作者是 unclecode。
现在的模型其实已经能读懂流程、模块和依赖关系。你把一段产品逻辑扔进去,它很快就能生成 Mermaid、SVG,或者一页带流程图的 HTML。但其实只靠模型的 Coding 能力,一次性能把关系画清楚,其实目前应该还不太行。文字密度、留白、连线不对、重叠等等毛病很难靠一句提示词解决。Diagram Design 这个开源项目把字号、间距、配色、节点数量和视觉层级写成规则,让 Agent 照着执行。
程序员做页面最容易卡住的地方,往往不是代码写不出来。按钮放哪、间距多大、卡片怎么排、弹窗怎样出现才舒服,这些问题每一个都能写代码,拼到一起却可能像十年前的后台管理系统。
现在有个省力得多的办法:把成熟的 UI 组件当成乐高,再让 Claude Code、Codex 这类编程 Agent 负责选型、取代码、改样式和接入现有项目。