Nahal · نهال
هوش مصنوعی فارسی

اجرای مدل‌های Gemma ۴ روی یک تراشه TPU v۵e با روش QAT

آموزش اجرای مدل‌های Gemma ۴ روی تراشه TPU v۵e با روش QAT و بهینه‌سازی وزن‌های int۴ برای افزایش سرعت پردازش و کاهش حافظه مصرفی در Google Cloud.

اجرای مدل‌های زبانی بزرگ روی سخت‌افزارهای محدود، چالشی است که با استفاده از وزن‌های QAT (Quantization-Aware Training) و بهینه‌سازی فرمت ذخیره‌سازی، به شکلی عملیاتی حل می‌شود. با بازآرایی این وزن‌ها در فرمت‌های int۴ و int۸ و استفاده از پچ‌های اختصاصی برای vLLM، می‌توان مدل‌هایی با ابعاد مختلف را روی یک تراشه Google Cloud TPU v۵e مستقر کرد. این رویکرد به کاربران اجازه می‌دهد بدون نیاز به خوشه‌های بزرگ، از توان پردازشی مدل‌های ۱۲B و حتی ۲۶B بهره‌مند شوند.

پیش‌نیازهای فنی برای راه‌اندازی در بستر ابری

برای شروع این فرآیند، ابتدا باید یک پروژه در Google Cloud با سهمیه TPU v۵e در منطقه us-west۴-a ایجاد کنید. همچنین داشتن یک مخزن ذخیره‌سازی ابری برای نگهداری چک‌پوینت‌ها و نتیجه‌های خروجی ضروری است. فرآیند اصلی شامل کپی‌برداری از مخزن gemma۴-dev و تنظیم توکن Hugging Face در Secret Manager است. پس از آماده‌سازی این زیرساخت، می‌توانید با استفاده از اسکریپت‌های موجود، وزن‌های QAT را به فرمت‌های بهینه تبدیل کنید.

گام‌های بازآرایی وزن‌ها

برای تبدیل وزن‌ها، باید از اسکریپت‌های اختصاصی جهت بازآرایی گروه‌های وزنی استفاده کنید تا جایگاه آن‌ها در شبکه ۱۶-سطحی حفظ شود. این کار باعث می‌شود مدل بدون نیاز به گرد کردن مجدد وزن‌ها، در قالب‌های فشرده‌ای قرار گیرد که vLLM به‌راحتی آن‌ها را پردازش می‌کند. برای نمونه، در مدل‌های ۱۲B، این روش باعث می‌شود وزن‌ها در فضای 11.31 گیگابایتی جای گیرند که با ظرفیت 15.75 گیگابایتی حافظه HBM در تراشه v۵e کاملاً سازگار است.

چه مدل‌هایی روی یک تراشه v۵e اجرا می‌شوند؟

نتایج نشان می‌دهد مدل‌های Gemma ۴ از نسخه E۲B تا ۱۲B با عملکردی هم‌تراز با مدل‌های bf۱۶ عمل می‌کنند. در مدل ۱۲B، سرعت خروجی به ۶۷۵ توکن در ثانیه می‌رسد که برای کاربردهای سازمانی بسیار کارآمد است. با این حال، مدل‌های بزرگ‌تر مانند ۲۶B محدودیت‌هایی در زمینه طول پنجره متن (Context) دارند و پس از ۲۱۷۶ توکن دچار محدودیت می‌شوند. هوش مصنوعی نهال با ارائه زیرساخت‌های مشابه، به سازمان‌ها کمک می‌کند تا این مدل‌ها را در محیط‌های داخلی و بدون پیچیدگی‌های فنی مستقر کنند.

نکات کلیدی

  • مدل‌های Gemma ۴ تا اندازه ۱۲B با استفاده از فرمت int۸ و int۴ روی یک تراشه v۵e با کارایی کامل اجرا می‌شوند.
  • استفاده از وزن‌های QAT، دقت مدل را تا 2.4 واحد نسبت به خروجی‌های استاندارد ۴-بیتی گوگل بهبود می‌دهد.
  • محدودیت حافظه HBM در تراشه v۵e اجازه اجرای مدل‌های بزرگ‌تر از ۲۶B را نمی‌دهد.
  • پچ‌های vLLM برای این سخت‌افزار شامل روش‌های W۸A۸ برای ضرب ماتریسی سریع‌تر و جداول جای‌گذاری (Embedding) فشرده است.

منبع: dev.to

مقاله‌های مرتبط

در حال بارگذاری نهال…