有人说“Web访问日志是服务器的江湖卷宗”。
随便建一个“无人”问津的小网站扔到公网上,然后你会发现:非正常访问记录远高于正常访问,机器人访问量远高于自然人访问。
这个Web站点部署在X云上,持续运行了2年多,每天一个Web日志文件,共计700多个日志文件,约4.8GB,最大日志文件66MB。
粗略估计,自然人正常访问次数仅占不到20%。
非正常(包括机器人访问)主要由以下几类:
日志中最多的是网络爬虫(Web Crawler/Spider/Robot,Search Engine Bot),爬虫搜索引擎用于自动遍历互联网、抓取并索引网页内容的自动化程序,例如:
还有很多其他爬虫,不再一一列举。
专门面向AI训练场景的智能数据采集程序,是大语言模型获取海量公开网页训练素材的核心工具,区别于传统通用爬虫,它能适配AI训练对数据质量、多样性的特殊要求。
DeepSeekBot抓取公开的网页内容,用于训练和优化DeepSeek自己的大语言模型(LLM),以提升模型的知识广度和语言理解能力。
GPTBot是OpenAI公司官方运行的网络爬虫。
ClaudeBot是人工智能公司Anthropic(Claude系列模型的开发商)官方运行的网络爬虫。
跨站脚本(Cross-site scripting,简称XSS)属于代码注入攻击,攻击者将恶意脚本注入正常网页,用户浏览时脚本会在其浏览器中执行,可窃取用户登录Cookie、劫持会话甚至控制用户浏览器。
SQL注入(SQL Injection)攻击是一种常见且高危的Web安全漏洞,攻击者将恶意SQL代码插入应用的输入字段中,利用程序未对用户输入做严格过滤、直接拼接进SQL语句的漏洞,诱使后台数据库执行非法指令,从而操控数据库操作。
服务器端请求伪造(SSRF,Server-Side Request Forgery),攻击者试图利用服务端对URL解析的漏洞,让服务器读取本地文件系统的内容,而不是正常的HTTP/HTTPS远程资源。