تسريب بيانات TikTok ضخمة تشمل مليارات المقاطع

اختراق تقني يكشف بيانات TikTok الوصفية لمليارات المستخدمين
شهدت الأوساط التقنية مؤخرًا حدثًا بارزًا أثار الكثير من الجدل، حيث قام مطور يطلق على نفسه اسم hashfunction بنشر مجموعة ضخمة من بيانات TikTok الوصفية لنحو 5.6 مليار مقطع فيديو عام. هذه البيانات أصبحت متاحة مجانًا على منصة Hugging Face المتخصصة في نماذج الذكاء الاصطناعي، وتغطي الفترة الزمنية الممتدة من يوليو 2014 وحتى أكتوبر 2026، وذلك بموجب رخصة استخدام غير تجاري.
تفاصيل التسريب الضخم على منصة Hugging Face
تُعد هذه المجموعة من البيانات ضخمة للغاية، حيث يبلغ حجمها الإجمالي 460 جيجابايت من ملفات Parquet المنظمة شهريًا. ومن المهم التوضيح أن هذه التسريبات لا تتضمن مقاطع الفيديو الفعلية، بل تشمل بيانات TikTok الوصفية التي تقدم تفاصيل دقيقة حول كل مقطع.
ما الذي تتضمنه هذه البيانات المسربة؟
- النصوص التوضيحية (Captions) والوسوم (Hashtags) المستخدمة في المقاطع.
- معرفات الصوت والنصوص التي تظهر على الشاشة أثناء العرض.
- بيانات المنتجات والبائعين المرتبطة بميزة متجر TikTok Shop.
- إحصائيات التفاعل التي تشمل عدد المشاهدات، والإعجابات، والتعليقات، والمشاركات، وعمليات الحفظ والتحميل.
- تصنيفات المنصة الخاصة، مثل ما إذا كان الفيديو مصنفًا كونه نتاج ذكاء اصطناعي أو إذا كان مستبعدًا من صفحة “For You”.
كيف تم تجاوز حماية منصة TikTok؟
أوضح المطور المسؤول عن هذا العمل أن عملية جمع بيانات TikTok تمت من خلال استهداف الواجهة البرمجية الخاصة بتطبيق الهاتف (Private Mobile API). واستخدم المطور تقنيات متقدمة لمحاكاة هويات أجهزة تعمل بنظام Android، مع هندسة عكسية لتوقيعات الطلبات وتزييف بروتوكولات الأمان TLS، مما سمح له بجمع البيانات دون الحاجة إلى تسجيل الدخول أو امتلاك حساب على المنصة.
ووفقًا لما نشره المطور، فقد تمكن النظام من جمع معلومات عن 3.23 مليار ملف شخصي لمنشئي المحتوى، و5.94 مليار فيديو، و2.8 مليار تعليق خلال ثلاثة أسابيع فقط. ورغم أن النسخة المجانية متاحة للباحثين، إلا أن موقع datasocial.ai يعرض تحديثات يومية وخدمات تجارية، بل ويبيع الكود المصدري للأداة المستخدمة في جمع البيانات مقابل 1,699 دولارًا.
التداعيات القانونية واستخدام البيانات في الذكاء الاصطناعي
تمنع شروط الخدمة في منصة TikTok استخراج البيانات باستخدام برامج آلية دون موافقة كتابية صريحة. وتأتي هذه الواقعة في وقت تشهد فيه الساحة القانونية صراعات كبرى حول جمع البيانات؛ حيث رفعت منصة Reddit دعاوى قضائية ضد شركات متخصصة في الذكاء الاصطناعي بتهمة حصاد محتواها على نطاق صناعي.
يسعى مطورو الذكاء الاصطناعي بشغف للحصول على مثل هذه النوعية من بيانات TikTok، لأنها تمثل مادة خام لتدريب النماذج على توقع المحتوى الرائج (Viral)، وفهم سلوك المستهلكين في التجارة الإلكترونية، وتطوير نماذج لغوية تفهم أسلوب الكتابة والتفاعل في مقاطع الفيديو القصيرة. وبينما توفر منصة TikTok أدوات بحث رسمية، إلا أنها مقيدة بشروط صارمة وتقتصر على الباحثين الأكاديميين المعتمدين، مما يجعل هذا التسريب وسيلة غير مشروعة لكنها مغرية للكثيرين في هذا المجال.




