شرکتهای هوش مصنوعی برای اسکن دیجیتال کتابهای فیزیکی آنها را برش میزنند و نابود میکنند تا مدلها را آموزش دهند. شرکتهای فعال در حوزه هوش مصنوعی که پیش از این سهم زیادی در ایجاد کمبود حافظه و فضای ذخیرهسازی داشتند، اکنون گنجینه تاریخ ادبیات بشریت را هدف قرار دادهاند و میلیونها جلد کتاب چاپی را پس از استخراج اطلاعات کاملاً نابود میکنند. براساس جزییاتی که در جریان پروندههای حقوقی و گزارشهای افشاگرانه مطرح شده، شرکتهای فناوری برای بالا بردن سرعت کار، روش اسکن تخریبی کتابها را انتخاب کردهاند. در این روش، شیرازه کتابها جدا شده و صفحات آنها به صورت مجزا وارد اسکنرهای صنعتی پرسرعت میشود تا متن آنها دیجیتالی شود. نتیجه این فرایند، نابودی فیزیکی و کامل میلیونها جلد کتاب است. «تام هاروی»، از فعالان پروژه گوگل بوکس که بعدها پروژه دیجیتالسازی شرکت آنتروپیک موسوم به «Project Panama» را رهبری کرد، در دادگاه تأیید کرده که این شرکت چند مجموعه اسکن اسناد مانند Datamation Information Services را به کار گرفته است. این مراکز خدمات اسکن غیرتخریبی (با اسکنرهای سقفی و V شکل) و اسکن تخریبی ارائه میدهند، اما شرکتهای هوش مصنوعی به دلیل هزینه کمتر و سرعت بسیار بالاتر، روش تخریبی و نابودی کامل کتابها را ترجیح میدهند. چالش شرکتهای هوش مصنوعی با ناشران سوابق موجود نشان میدهد که شرکت آنتروپیک بهعنوان یکی از توسعهدهندگان مطرح این حوزه، میلیونها دلار برای استخراج اطلاعات از کتابهای چاپی جهت ساخت مدلهای Claude هزینه کرده و سپس این کتابها را از بین برده است. این شرکت کتابها را از مجموعهداری به نام Better World Books تهیه میکرد. هرچند حکم دادگاه اخیراً استفاده از کتابها برای آموزش هوش مصنوعی را مصداق «استفاده منصفانه» در قانون کپیرایت دانست، اما آنتروپیک به دلیل نگهداری آرشیوی شامل ۷ میلیون نسخه کتاب دزدی دیجیتال که حقوق پدیدآورندگان و ناشران را نقض میکرد، با جریمه سنگین ۱.۵ میلیارد دلاری مواجه شد. در اقدامی مشابه، ائتلافی از ناشران نیز دادخواستی علیه گوگل تنظیم و این شرکت را به استفاده غیرقانونی از میلیونها جلد کتاب دارای کپیرایت برای توسعه مدلهای جمینای متهم کردهاند. علت اصلی تمایل غولهای فناوری به نابودی کتابهای چاپی، نیاز شدید آنها به دادههای آموزشی باکیفیت است. درحالحاضر انتشار گسترده محتواهای بیکیفیت تولیدشده توسط هوش مصنوعی که با نام «AI slop» شناخته میشوند، فضای اینترنت را آلوده کرده است. به همین دلیل، این شرکتها با بهرهگیری از واسطهها بهطور پنهانی اقدام به خرید عمده کتابهای دستدوم منتشرشده قبل از سال ۲۰۲۲ میکنند تا بدون جنجال رسانهای، به متون اصیل دسترسی داشته باشند. پایگاه داده آنلاین ISBNdb که بیش از ۱۱۱ میلیون کتاب در آن ثبت شده، بستر اصلی این خریدهای کلان است. سفارشهای ثبتشده در این سامانه از ۱,۰۰۰ جلد تا حتی ۱ میلیون جلد کتاب در قالب یک معامله متغیر است. یکی از کتابفروشان حرفهای در گفتگو با رسانه 404 Media به افزایش بیسابقه فروش کتاب اشاره کرده است؛ فروش هفتگی او از حدود ۲۰ جلد به چند صد جلد رسیده که نشاندهنده افزایش ۵ برابری است. خریداران بدون توجه به موضوع یا نویسنده، تنها کتابهای دارای شماره شابک (ISBN) را حتی با قیمتهای بسیار بالا و گران خریدهاند. درحالیکه کتابهای چاپی گنجینهای از اطلاعات را برای هوش مصنوعی فراهم میکنند، اما خروج آنها از چرخه گردش و نابودی فیزیکیشان چالشهای اخلاقی فراوانی دارد. مشخص نیست که آیا عناوین کمیاب پیش از تخریب جداسازی میشوند یا خیر. از سوی دیگر، متون اسکنشده مستقیماً وارد پایگاههای داده خصوصی شرکتها میشوند و عموم مردم به آنها دسترسی ندارند؛ وضعیتی که باعث میشود دستیابی به نسخههای پیشرفتهتر هوش مصنوعی به قیمت سلب دسترسی نسلهای آینده از منابع اطلاعاتی تمام شود.