数据抓取

“龙虾之父”质疑SkillHub未经沟通抓取数据

“龙虾之父”质疑SkillHub未经沟通抓取数据 3月12日,围绕开源项目OpenClaw与腾讯旗下AI平台SkillHub的数据抓取争议引发行业关注。“龙虾之父”OpenClaw创始人彼得・斯坦伯格公开指出,腾讯在未进行事前沟通的情况下大规模抓取其平台数据,导致官方服务器面临高达五位数美元的成本压力。面对开发者的质疑,腾讯官方迅速作出回应,强调SkillHub在上线首周为用户处理了 180GB的数据流量,但实际仅向官方源站发起1GB的非并发请求,在客观…

SerpApi反击谷歌 称谷歌才是全球最大爬虫

SerpApi反击谷歌 称谷歌才是全球最大爬虫 提供网络内容抓取工具的公司SerpApi,正在对谷歌提起的版权诉讼进行反击,诉讼指控SerpApi以惊人的规模抓取搜索结果。在周五提交的一份驳回动议中,SerpApi辩称,谷歌对其搜索结果并不拥有版权,并指称该搜索引擎是建立在那些发布 ‘世界信息’ 的其他人之上的。去年12月,谷歌起诉了SerpApi,声称这家较小的抓取公司通过使用欺骗性手段访问和抓取其搜索结果,违反了版权法。谷歌还声称,SerpApi找到…

安娜的档案抓取Spotify高达300TB数据

安娜的档案抓取Spotify高达300TB数据 安娜的档案声称已抓取了Spotify几乎全部的内容。根据一篇新的博客文章,该组织已归档了2.56亿条曲目的元数据以及8600万首歌曲的音频文件,覆盖Spotify上约99.6%的所有收听量。完整档案大小略低于300TB,正通过批量种子文件按受程度排序分发。该组织将该项目定位为音乐的 “保存档案”。他们认为,虽然流行歌曲有很好的版权支持,但若音乐串流平台停止运营或失去版权,大量不太知名的音乐可能会消失。归档音…

CC宣布对AI“付费抓取”系统给予暂时支持

CC宣布对AI“付费抓取”系统给予暂时支持 今年早些时候宣布了开放人工智能生态系统框架后,非营利组织知识共享(CC)现已公开支持 “付费抓取” 技术,这是一种当网站内容被人工智能网络爬虫等机器人访问时,自动补偿网站的系统。七月,该组织宣布了一项计划,旨在为数据控制公司与希望利用数据训练的人工智能供应商之间的数据集共享提供法律与技术框架。现在,该非营利组织正暂时支持付费抓取系统,称其持谨慎支持态度。知识共享组织说:“若负责任地实施,付费抓取可为网站提供一种…

Reddit 起诉 Perplexity 非法抓取其数据

Reddit 起诉 Perplexity 非法抓取其数据 社交媒体平台Reddit公司已对Perplexity提起版权诉讼,指控这家AI公司为训练其搜索引擎所用模型而非法抓取Reddit数据。周三在纽约联邦法院提起的这起诉状,标志着人工智能团体之间围绕涉嫌受版权保护材料的最新法律纠纷。Reddit还起诉了三家较小的团体:立陶宛的数据抓取公司Oxylabs、“前俄罗斯僵尸网络”AWMProxy,以及得克萨斯初创公司SerpApi。Reddit称,这三家公…

社交网站 Reddit 将屏蔽互联网档案馆

社交网站 Reddit 将屏蔽互联网档案馆 Reddit表示,其发现人工智能公司从互联网档案馆的网站时光机抓取其数据,因此该平台将开始阻止互联网档案馆索引Reddit的绝大多数内容。网站时光机将不再能够抓取帖子详情页、评论或个人资料;相反,将只能索引Reddit.com主页,这实际上意味着互联网档案馆将只能存档关于哪些新闻标题和帖子在特定日期最受欢迎的洞见。发言人蒂姆·拉茨施密特表示:“互联网档案馆为开放网络提供服务,但我们们已获悉人工智能公司违反平台政…

Cloudflare 发现 Perplexity 抓取明确禁止AI爬虫的网站

Cloudflare 发现 Perplexity 抓取明确禁止AI爬虫的网站 互联网基础设施提供商 Cloudflare 称,人工智能初创公司 Perplexity 正在抓取和爬取那些已明确表示不希望被抓取的网站内容。周一, Cloudflare 发布研究表示,其观察到这家人工智能初创公司忽略了阻止并隐藏其爬取和抓取活动。这家网络基础设施巨头指控Perplexity在试图抓取网页时隐藏其身份,以试图规避网站的偏好设置, Cloudflare 的研究人员写…

加载更多博文
未找到任何结果