近日,关于生成式人工智能训练数据合法性的问题再次成为焦点。在《纽约时报》版权案件中解密的法庭文件中,微软应用科学总监布伦特·赫克特在内部讨论中提到,目前大型语言模型的训练方式可能是“人类历史上最大规模的劳动窃取”,这一表述引发业内广泛关注。
赫克特在讨论微软、OpenAI及其他企业如何利用互联网上的大量内容进行模型训练时,指出这一过程是“前所未有规模的惊人窃取”,并进一步强调这或为“人类历史上最大规模的劳动窃取”。这一内容是在《纽约时报》等新闻机构对微软和OpenAI提起的版权诉讼中披露的,原告认为这两家公司未获授权地使用新闻和受版权保护的内容来训练其人工智能模型,从而开发商业产品。
面对指控,微软和OpenAI表示其采取了“合理使用”的立场,认为模型训练类似于学生通过阅读书籍获取知识。从而不构成侵权。此外,他们指出,人工智能生成的内容已对原始材料进行了足够的转化,因此不算直接复制。然而,赫克特的部分内部交流记录与这一路线明显形成对比,他提到如要赢得诉讼,相关企业可能需要“彻底嘲弄合理使用这一概念”,被原告视作质疑两家公司长期以来版权辩护逻辑的重要证据。 球友会
此外,文件中还揭示了一些来自OpenAI内部的讨论。例如,OpenAI联合创始人格雷格·布罗克曼承认,当模型接触《纽约时报》内容时,ChatGPT确实能够预测并续写相关句子。这帮助原告证明模型具备重现原始作品的能力,而不仅是简单的信息学习。
赫克特还在内部文档中提出了“末日循环”的概念,指出人工智能回答引擎逐渐减少了用户访问新闻网站的需求,导致媒体流量和收入下降,进而影响内容生产者的生存能力,并减少可供人工智能学习的信息来源,从而损害整个互联网生态。
在此基础上,原告方引用了微软的内部数据,显示Copilot等AI工具对一些新闻网站流量造成了显著影响。在一些案例中,相较于传统搜索结果,用户点击《纽约时报》页面的比例下降超过90%。 球友会
关于训练数据来源的争议已成为当前人工智能行业面临的主要法律挑战之一。OpenAI曾表示,完全在不接触受版权保护内容的情况下训练先进的AI几乎不可能。Meta前高管尼克·克莱格也曾评述,若严格遵循传统版权规则,许多当前的AI系统将难以持续发展。
多家科技公司,包括微软、Meta等,因训练数据来源问题持续遭到外界质疑。他们被指控在未获得授权或补偿的情况下使用用户内容、代码、文章、图片等进行模型训练。
随着《纽约时报》案件的推进,越来越多的内部文件被逐步公开,业内认为这些材料不仅关系到微软与OpenAI的版权诉讼结果,也可能影响未来全球关于人工智能训练、知识产权保护及内容生产者权益分配的监管方向。目前,该案件仍在审理中,该法律争议可能成为未来AI产业发展规则的重要里程碑。 球友会
2026-09-20
2026-09-20