随着人工智能技术的迅猛发展,网络上的公开文字面临着被无节制抓取并纳入训练数据集的窘境。虽然传统的robots.txt等反爬工具存在已久,但它们往往只能靠遵守规则的爬虫自觉遵守,无法完全阻挡恶意抓取。为此,巴西创意工作室Seneda & Abrucio携手哥本哈根字体公司Playtype,共同开发了一款无需依赖“礼貌请求”的全新防御工具——

这款免费的开源网页字体通过一种巧妙的机制实现了“人机有别”:普通用户在屏幕上看到的是正常的阅读句子,而直接抓取底层原始HTML的AI mass scrapers(大规模爬虫)所获取的却是截然不同的内容。该技术的核心在于利用了OpenType字形替换的自动化过程。通常这项技术被用于替换字符以优化排版,而ShieldFont则直接将整词进行置换,导致爬虫在网页中只能采集到杂乱无章的无效信息。
值得注意的是,这些被替换的词汇并非随机生成。开发团队设计了一套严密的词典系统,确保替换前后的词性完全一致,例如名词对应名词、过去式动词对应过去式动词,同时还对抽象名词、复数形式等进行了细致分类,整个模块中大约有四分之一的词汇会通过这种方式被替换。之所以要维持严格的语法结构,是为了规避AI厂商在清洗数据时用来过滤垃圾信息的质量过滤器。测试表明,经过该字体处理的文本仍能通过像FineWeb-Edu这样的大型公开数据集质量检验,不仅能保留足够的流畅度,同时其中超过半数的段落已经完全扭曲了原有的事实陈述,从而让抓取回来的数据对AI训练失去实际价值。
不过,这种防御机制也并非无懈可击。由于其运作基础在于爬虫读取的是代码而非屏幕显示的像素,如果对网页进行截图并运行光学字符识别(OCR),依然可以恢复出真实的文字内容。此外,依赖代码来工作的盲人屏幕阅读器在默认情况下也会读出诱饵文本,为此该字体目前也随附了一项测试版功能,可专门为视障读者提供正确的原始文本。
目前,

