英伟达被起诉:使用盗版书训练大语言模型

发布时间:2026-02-10 阅读量:486 来源: 发布人: bebop

导读:2024年初,多位知名作家联合对英伟达(NVIDIA)提起集体诉讼,指控其AI模型在训练过程中非法使用了来自“影子图书馆”如Anna's Archive和Books3的盗版图书。然而,面对这一版权侵权指控,英伟达于2026年1月29日正式向加州北区联邦法院提交动议,要求驳回该诉讼,并坚决否认曾使用任何受版权保护的盗版书籍进行模型训练。


据了解,这起诉讼的原告方是五位拥有多部已注册版权作品的作家。起诉书指控英伟达在使用NeMo Megatron框架开发其下一代大语言模型时,使用了包含原告版权作品的盗版图书馆的数据集,这些盗版图书馆也被称为“影子图书馆”。


NeMo Megatron是英伟达开发的一个用于构建、训练和部署大语言模型的端到端框架。


原告在美国加利福尼亚北区联邦地区法院提起诉讼。2026年1月31日,英伟达提交了正式动议,认为原告未能提供足够的证据证明该公司存在侵权行为,要求法院驳回原告起诉状,并主张其行为属于“合理使用”。法院已安排在 2026年4月2日举行听证会,审理英伟达提出的动议。


起诉书提供的内部记录显示,英伟达面临着OpenAI的竞争压力,为了在 2023 年开发者大会上展示其领先的技术,不惜通过“影子图书馆”获取数百万本盗版图书来训练其大语言模型。此外,起诉书还指出,英伟达向其客户提供工具和脚本,鼓励并协助他们下载盗版数据集 。


针对上述指控,英伟达在2026年1月29日提交的驳回动议中明确指出,原告未能提供任何具体、可验证的事实来证明其作品被实际下载、复制或用于任何AI模型的训练过程。公司强调,仅凭内部员工对某网站的“访问可能性”进行讨论,并不等于公司实施了版权侵权行为。


“讨论一个数据源的存在,与实际使用该数据源中的内容,是两个完全不同的概念。”英伟达在动议中写道,“版权法要求原告必须在起诉阶段就提供足以支撑‘复制行为’发生的事实依据,而非依赖推测或假设。”


此外,英伟达批评原告大量使用“基于信息与信念”(on information and belief)这类模糊表述,试图绕过起诉阶段应完成的基本举证义务,转而希望通过证据开示程序“倒查”是否存在侵权。公司指出,这种做法不符合美国联邦民事诉讼规则对版权侵权案件的基本要求。


目前,该案由加州北区联邦法院法官Jon Tigar审理。英伟达提出的驳回动议将于2026年4月2日举行听证。若法院支持该动议,原告或将面临败诉风险;若驳回请求被否决,案件将进入证据开示阶段,届时更多内部文档与技术细节可能被公开。


相关资讯
我们还需要GPU吗?从LineShine登顶看纯CPU超算的四层技术突围

在英伟达GPU与CUDA生态长期主导AI训练与科学仿真的背景下,国产LineShine(灵晟)纯CPU超算以2.198 EFlops持续双精度性能登顶TOP500,印证了“矩阵增强型CPU”正在重构HPC底层硬件标准。 近日,Jack Dongarra、Satoshi Matsuoka、Torsten Hoefler三位HPC权威联合发表《Do We Still Need GPUs? Rethinking AI and Scientific Computing on Matrix-Enhanced CPUs》,系统拆解了无GPU同构超算的四层技术体系:处理器指令集硬件加速、统一HBM高带宽内存架构、全精度混合运算单元、原生高速互联网络。

从“回答问题”到“完成任务”:AI产业正在发生的五个结构性转向

回顾AI今年的发展轨迹,我们能察觉到一种质的变化:AI不再只是被展示、被调用的“展品”,而是拥有了更明确的“行动感”。从代码编写到机器人奔跑,从算力基建到未来接口,行业正集体从“回答问题”走向“完成任务”。 我们试图透过五个数字,捕捉这一轮产业变革中的关键切片。

ROHM车载MOSFET新品:抑制二次击穿,SOA范围扩大5倍

全球知名半导体制造商ROHM近日宣布,面向车载安全功能和保护电路开发出100V耐压MOSFET新品“RS4P063BPHZG”

斩获SAIL最高奖背后:DF1000如何破解国产算力“存不够、改不动”?

2026 WAIC落下帷幕,国内AI算力产业的共识正发生清晰转向:单点参数竞赛逐渐退潮,超节点集群、全产业链自主可控与底层架构原始创新成为核心主线。在此背景下,首次参展的东方算芯凭借“高能效软件定义近存计算芯片DF1000”斩获大会最高荣誉SAIL奖。这座奖杯背后,指向了一条不依赖先进制程与既有生态的突围之路。