英伟达等巨头被曝违规使用YouTube数据训练模型，涉17万个视频

慧聪广电网 2024-07-18 09:57 来源：IT之家作者：故渊

【慧聪广电网】7 月 17 日消息，非营利性新闻工作室 ProofNews 昨日（7 月 16 日）发布博文，表示包括苹果、英伟达、Salesforce 和 Anthrophic 在内的大型科技公司，在训练其 AI 模型时均使用了来自 YouTube 的视频资源。

报道称这些科技公司在训练其 AI 模型过程中，使用了名为 YouTube Subtitles 的数据集，大小为 5.7GB（4.89 亿个单词）。

该数据集由 EleutherAI 创建，最早发布于 2020 年，涉及超过 48000 个频道的 173536 个 YouTube 视频字幕内容，其中还包含 12000 多个平台已删除视频的字幕内容。

YouTube Subtitles 数据集主要采集热门 YouTube 频道的资源，IT之家附上相关信息如下：

MrBeast（2.89 亿订阅者，其中有 2 段视频用于训练）

Marques Brownlee（1900 万订阅者，有 7 段视频）

Jacksepticeye（近 3100 万订阅者，有 377 段视频）

PewDiePie（1.11 亿订阅者，有 337 段视频）

YouTube Subtitles 数据集隶属于一个名为“The Pile”的数据集，其中包括其他几个训练数据集。大多数“The Pile”数据集都对任何有足够空间和计算能力的人开放。

免责声明:凡注明来源本网的所有作品，均为本网合法拥有版权或有权使用的作品，欢迎转载，注明出处。非本网作品均来自互联网，转载目的在于传递更多信息，并不代表本网赞同其观点和对其真实性负责。

推荐阅读