网页爬虫,可以爬到哪里 — 合法收集数据的 4 个标准
网页爬虫是完全可以合法进行的。 대법원 在 2021도1533 判决中,对从竞争对手 App API 服务器收集信息的行为,将起诉的三个罪名 — 정보통신망법 违反、妨害业务(컴퓨터등장애업무방해)、저작권법 违反 — 全部判为无罪。产生分歧的,是对象与方法三个方面。
| 分项 | 依据条文 | 设计中要确认的 |
|---|---|---|
| 访问权限 | 정보통신망법 §48① | 是否有登录·验证码等保护措施,用户条款中是否禁止收集 |
| 个人信息 | 개인정보보호법 §15① | 是否掺入姓名·联系方式。一旦掺入,先确定依据 |
| 作品·数据库 | 저작권법 §16, §93①② | 是否复制全部后重新加工,还是只取其中所需的一部分 |
① 访问权限 — 是否进入了受限之处
정보통신망법 제48조 제1항 禁止“无正当访问权限,或超出被允许的访问权限入侵信息通信网络“。
“受限之处”到哪里为止,大法院已经划定。
服务提供者是否限制了访问权限,应综合考量保护措施、用户条款等客观呈现的多种情况,审慎作出判断。
— 대법원 2022. 5. 12. 선고 2021도1533
robots.txt 不是保护措施。 标准(RFC 9309)自己就写明“不是有效内容安全手段的替代品”。违反它不会立即违法,遵守它也不保证合法。要读并遵守,但不能只靠它安心。
② 个人信息 — 是否掺入了关于人的信息
개인정보보호법 제15조 제1항 将可以收集·利用的情形限定列举(同意、法律的特别规定、合同的签订·履行等)。
一旦掺入姓名·联系方式·地址,就与是否爬虫无关地受到另行规制。先确定目的与法律依据,再开始。
③ 作品·数据库 — 取走多少
数据库制作者享有“复制、发行、广播或传输全部或相当部分的权利“(저작권법 §93①)。
这里实务常有误解。单个素材一件不是“相当部分”,但一点一点长期刮取并不等于没事 — 如果反复、系统性地进行,最终形成与复制了相当部分相同的结果,就视为侵权(§93②)。
您只需提供预期的采集对象与方式即可。 我们将免费为您梳理合规的采集方案与可行范围,若您正考虑外包,实际数据采集项目15万韩元起即可启动。
这三条之外要遵守的
- 不给服务器造成负担 — 收集周期保持在真人使用的水平,限制并行请求数。集中猛发,就成了妨碍第三方服务的方式。
- 不隐瞒自己是机器人 — 在 User-Agent 中写明目的与联系方式。
确认顺序
- 直接阅读目标网站的用户条款·robots.txt
- 判断收集对象是否为个人信息、是否为数据库的相当部分
- 案情纠缠不清时,接受法律专家的审查
1 排在最前是有理由的。 与法律无关,有时条款已经划定范围 — 尤其是需要登录使用的卖家·店主系统。这先于法律判断,是合同问题,先看就不必之后返工。
再补充一点。2021도1533 是刑事案件。 不能因为刑事上被判无罪,就解读为连民事责任也没有。
总结
大部分收集都可以毫无问题地进行。 대법원 将三个罪名全部判为无罪,也正因为如此 — 不进入被拦住的地方,不碰个人信息,不把别人的数据库整个搬走,不给服务器添乱,就可以了。
卡住的往往不是「能不能做」,而是「做到哪里为止」。 先把这条线画好,就不会在做成之后返工。
自己判断时真正卡住的地方,不是法律解释,而是其后 — 条款没有明文时,目标是登录后的画面时,个人信息是否掺入难以判断时。这类问题只看条文定不了案,要连同收集设计一起看才能下判断。咨询收集设计审查,我们会按对象整理给您。
只要您想收集的网站地址就够了。
用一句话告诉我们想收集什么,我们会先确认条款·robots.txt·是否涉及个人信息,整理出是否可行、可行到哪里。审查之后,再决定是否投入开发即可。
参考资料
- 정보통신망법 제48조 제1항 · 개인정보보호법 제15조 제1항 · 저작권법 제16조·제93조 제1항·제2항 [确认 — 국가법령정보센터]
- 대법원 2022. 5. 12. 선고 2021도1533 [确认 — 判决书原文。被起诉的 3 个罪名全部无罪]
- RFC 9309 Robots Exclusion Protocol [确认 — IETF, 2022]
本文依据
法规已对照 국가법령정보센터 原文核实 — 정보통신망법 제48조 제1항, 저작권법 제16조·제93조 제1항·제2항, 개인정보보호법 제15조 (2026-08-16 确认)。判例为 대법원 2022. 5. 12. 선고 2021도1533(刑事,被起诉的 3 个罪名全部无罪)。robots.txt 的性质已通过 RFC 9309(IETF,2022)原文确认。