Granite PatchTST-FM-r2 آیبیام: بهترین مدل zero-shot با مجوز آزاد
مدل سریزمانی ۳۸۵ میلیون پارامتری که بدون fine-tuning پیشبینی میکند و با Apache 2.0 قابل استفاده تجاری است.

IBM نسخه دوم PatchTST را با دو مجوز Apache 2.0 و OpenMDW منتشر کرد؛ رتبه اول zero-shot با مجوز آزاد در GIFT-Eval و رتبه سوم CRPS در کل رتبهبندی.
آیبیام جدیدترین مدل خانواده Granite Time Series به نام PatchTST-FM-r2 را با مجوز متنباز تجاریپسند منتشر کرد. این مدل با حدود ۳۸۵ میلیون پارامتر و کانتکست تا ۸۱۹۲ گام، تا ۸ سپتامبر ۲۰۲۶ در رتبهبندی GIFT-Eval بهترین مدل zero-shot با مجوز آزاد است. کاربر بین دو مجوز Apache 2.0 و OpenMDW 1.0 انتخاب میکند و استفاده تجاری بلامانع است.
PatchTST-FM-r2 در GIFT-Eval چه رتبهای آورده؟
در میان مدلهای zero-shot قابلبازتولید، r2 رتبه دوم کلی را با CRPS هندسی ۰.۴۶۷ و MASE هندسی ۰.۶۸۴۶ گرفته — فقط پشت سر TimesFM-3.
نکته جالبتر: وقتی مدلهای pretrained هم وارد مقایسه میشوند (مدلهایی که اجازه دارند داده آموزش بنچمارک را در کورپوس داشته باشند)، این مدل رتبه سوم CRPS و رتبه چهارم MASE را حفظ میکند و از Chronos-2، Timer-S1 و Toto پیشی میگیرد؛ رقبایی که بعضاً بسیار بزرگترند.
معماری r2 نسبت به r1 چه تغییری کرده؟
نسخه r1 از بلوکهای ترنسفورمر استاندارد استفاده میکرد. در r2 این بلوکها با ساختار کانفورمر جایگزین شدهاند: دو لایه feed-forward نیمهمرحلهای که self-attention چندسر و یک لایه کانولوشن زمانی را احاطه میکنند. کانولوشن روابط کوتاهمدت را پوشش میدهد و attention روی وابستگیهای بلندمدت تمرکز میکند — الگویی که در نمودارهای attention روی داده ETTh1 هم دیده میشود.
کرنلهای کانولوشن با اندازههای ۳ و ۵ و در الگوی تکرارشونده {5, 5, 3, 3} بهکار رفتهاند. تعداد بلوکها از ۲۰ به ۳۰ رسیده و پچها با ۵۰ درصد همپوشانی، وزندهی پنجره Hamming و روش overlap-and-add مرزهای پیشبینی را نرم میکنند.
خروجی مدل هم فقط یک عدد نیست: سر پیشبینی ۹۹ کوآنتایل ارائه میدهد، یعنی هم پیشبینی نقطهای دارید و هم بازه اطمینان.
داده آموزش مدل چقدر شفاف است؟
کورپوس پیشآموزش بهطور کامل مستند شده: دادههایی از GiftEvalPretrain، داده سینتتیک مبتنی بر KernelSynth، کورپوس TSMixup (محدود به دیتاستهای خارج از مجموعه ارزیابی GIFT-Eval) و حدود ۵۰۰ هزار دنباله سینتتیک CauKer با طول ۴۰۹۶.
این شفافیت برای تیمهای حاکمیت داده اهمیت دارد؛ میتوانند بررسی کنند آیا داده بنچمارک به آموزش نشت کرده یا نه. IBM صراحتاً میگوید این کار نیاز به بازبینی مجوزی و حاکمیتی داخلی را حذف نمیکند، اما ابزار لازم برای آن را میدهد.
چطور میشود از PatchTST-FM-r2 استفاده کرد؟
بدون fine-tuning، فقط تاریخ اخیر سری را به پایپلاین میدهید و پیشبینی همراه با کوآنتایلهای درخواستی تحویل میگیرید — برای تقاضا، تلهمتری، مصرف انرژی، ترافیک یا هر سری زمانی با نمونهبرداری منظم.
پیادهسازی معماری در مخزن Granite-TSFM موجود است و با چکپوینتهای نسخه r1 سازگاری پسرو دارد؛ مهاجرت برای کاربران قبلی دردسر جدی ندارد.
IBM و Confluent هم چند مدل خانواده Granite Time Series شامل PatchTST-FM-r1، FlowState-r1.1، TTM-r3 و TSPulse را از طریق برنامه Early Access در Confluent Cloud عرضه کردهاند. استنتاج مستقیماً روی جریانهای زنده با Apache Flink اجرا میشود و لازم نیست داده به یک محیط ML جدا منتقل شود.
مدلهای سریزمانی عمومی شاید به اندازه LLMها سر و صدا نکنند، اما انتشار یک مدل SOTA با مجوز کاملاً آزاد و کورپوس مستند، دقیقاً همان چیزی است که تیمهای داده برای تولید واقعی لازم دارند.
سؤالات رایج
PatchTST-FM-r2 تحت چه مجوزی منتشر شده؟ تحت دو مجوز Apache 2.0 و OpenMDW 1.0 و کاربر میتواند هرکدام را انتخاب کند؛ استفاده تجاری مجاز است.
آیا برای استفاده از این مدل باید fine-tuning انجام داد؟ نه. مدل zero-shot است؛ کافی است تاریخ اخیر سری را به پایپلاین بدهید و پیشبینی همراه با کوآنتایلها دریافت میکنید.
آیا چکپوینتهای نسخه قبلی هنوز کار میکنند؟ بله، r2 با چکپوینتهای PatchTST-FM-r1 سازگاری پسرو دارد و مهاجرت ساده است.
بیشتر بخوانید
ادامه دهید — دنیای هوش مصنوعی بیپایان است
برای خواندن تحلیلهای بیشتر، صفحهٔ اصلی یا دستهٔ مرتبط را دنبال کنید. میتوانید با میانبرهای صفحهکلید هم بین مقالهها جابهجا شوید.
منبع اصلی خبر
Hugging Face Blog
https://huggingface.co/blog/ibm-research/ibm-releases-sota-granite-time-seriesتحریریه هوشنامه این خبر را بر اساس گزارش منبع اصلی بازنویسی و ویرایش کرده است. برای جزئیات بیشتر به منبع مراجعه کنید.
اخبار مرتبط
مدلهاOpenAI و مسئله ناویر–استوکس: اثبات تازه و جنجال اعتباردهی
مدل داخلی OpenAI با اجرای همزمان ۱۰٬۰۰۰ ایجنت ادعای حل ناویر–استوکس را مطرح کرد؛ اتهام استفاده بدون ذکر منبع از کار دو ریاضیدان، این دستاورد را جنجالی کرده است.
مدلهاGPT-Live-1: مدل صوتی تمامدوطرفه اوپنایآی در API
مدل صوتی GPT-Live-1 در API اوپنایآی عرضه شد؛ با مکالمه تمامدوطرفه، صداهای سفارشی و پشتیبانی تلفنی برای ساخت دستیارهای صوتی.
مدلهاGPT-6 Astra معرفی شد؛ مدل سازمانی OpenAI با کار بدون API
رکورد ۵۷.۹٪ در Terminal-Bench 4.0، قیمت ۱۰ دلار برای هر میلیون توکن ورودی و کنترلهای مدیریتی تازه؛ GPT-6 Astra وارد میدان رقابت سازمانی شد.