فهرست مطالب
بسیاری تصور میکنند برای اجرای یک مدل هوش مصنوعی حتماً به یک سیستم قدرتمند با کارت گرافیک گرانقیمت نیاز دارند؛ اما واقعیت این است که برای بسیاری از کاربردها، یک VPS مناسب هم میتواند میزبان یک مدل زبانی باشد. انتخاب درست سرور، مدل و تنظیمات اجرا اهمیت بیشتری از خرید قویترین سختافزار دارد.
نصب هوش مصنوعی روی VPS زمانی منطقی است که بخواهید کنترل بیشتری روی مدل داشته باشید، دادهها روی سرور خودتان باقی بمانند یا یک API اختصاصی برای استفاده از مدل ایجاد کنید. البته هر VPSای برای این کار مناسب نیست؛ مقدار رم، توان پردازنده، نوع ذخیرهسازی و داشتن یا نداشتن GPU مستقیماً روی تجربه استفاده تأثیر میگذارند.
در این راهنما مسیر کامل راهاندازی یک مدل هوش مصنوعی روی VPS ؛ از انتخاب سرور و سختافزار مورد نیاز گرفته تا نصب Ollama، اجرای مدل، ساخت API و راهاندازی Open WebUI برای استفاده از مدل در مرورگر را بررسی میکنیم
آیا VPS معمولی برای اجرای مدل هوش مصنوعی مناسب است؟

بله، اما نه برای هر مدل و هر نوع استفادهای. یک VPS معمولی بدون کارت گرافیک میتواند مدلهای کوچک و متوسط زبانی را اجرا کند، اما سرعت پاسخدهی آن با سرورهای مجهز به GPU قابل مقایسه نیست.
برای مثال، اجرای یک مدل ۷ یا ۸ میلیارد پارامتری با نسخه کوانتیزهشده روی یک VPS با رم کافی امکانپذیر است. اما اگر هدف شما پاسخگویی سریع به چندین کاربر همزمان، تولید متن طولانی یا استفاده تجاری سنگین باشد، محدودیتهای CPU خیلی زود مشخص میشوند.
به بیان سادهتر، اجرای موفق یک مدل به این معنی نیست که سرور برای استفاده واقعی مناسب است. ممکن است مدل روی VPS اجرا شود، اما هر پاسخ چندین ثانیه یا حتی بیشتر زمان ببرد.
تفاوت اجرای مدل روی CPU و GPU
مدلهای هوش مصنوعی برای پردازش حجم زیادی از محاسبات طراحی شدهاند. تفاوت اصلی CPU و GPU در تعداد عملیات موازی است.
CPU معمولاً تعداد هستههای کمتر اما قدرتمندتری دارد و برای کارهای عمومی سرور ساخته شده است. در مقابل، GPU هزاران هسته کوچکتر دارد که برای انجام محاسبات موازی سنگین بسیار مناسب هستند.
در اجرای مدل زبانی، GPU میتواند بخش زیادی از محاسبات مربوط به تولید پاسخ را سریعتر انجام دهد. به همین دلیل سرویسهایی که تعداد زیادی درخواست دریافت میکنند معمولاً از سرور GPU استفاده میکنند.
اما این تفاوت همیشه به معنی نیاز قطعی به GPU نیست. اگر فقط میخواهید یک مدل را آزمایش کنید، برای استفاده شخصی دستیار متنی بسازید یا یک API با تعداد درخواست محدود داشته باشید، اجرای مدل روی CPU هم میتواند انتخاب مناسبی باشد.
برای درک بهتر تفاوت، فرض کنید یک مدل ۸ میلیارد پارامتری را روی VPS اجرا میکنید:
- روی CPU، مدل ممکن است اجرا شود اما سرعت تولید متن محدود باشد.
- روی GPU مناسب، همان مدل میتواند چند برابر سریعتر پاسخ تولید کند.
- در استفاده همزمان چند کاربر، فاصله عملکرد بین این دو حالت بیشتر میشود.
چه زمانی VPS معمولی کافی است؟
اجرای هوش مصنوعی روی سرور بدون GPU برای بعضی سناریوها کاملاً کاربردی است. مهم این است که انتظار درستی از سرور داشته باشید.
VPS معمولی معمولاً برای این موارد مناسب است:
- آزمایش مدلهای زبانی مختلف
- ساخت نمونه اولیه یک محصول
- استفاده شخصی از چتبات
- اجرای مدل برای تعداد کم کاربر
- پردازش متنهای محدود
- ساخت API داخلی برای یک مجموعه کوچک
برای مثال، یک تیم کوچک میتواند یک مدل فارسی یا چندزبانه را روی VPS نصب کند و برای خلاصهسازی متن، پاسخگویی به اسناد داخلی یا جستوجوی اطلاعات شرکت از آن استفاده کند.
در چنین شرایطی، هزینه کمتر VPS بدون GPU ممکن است ارزش بیشتری نسبت به خرید یک سرور گرافیکی داشته باشد.
مرتبط: چگونه استفاده از مکالمات شخصی برای آموزش مدلهای هوش مصنوعی را غیرفعال کنیم؟
چه زمانی به سرور مجهز به GPU نیاز داریم؟
اگر سرعت پاسخ یا تعداد کاربران اهمیت زیادی دارد، GPU به یک نیاز جدی تبدیل میشود.
سرور GPU معمولاً برای این کاربردها انتخاب میشود:
- ارائه سرویس هوش مصنوعی به مشتریان
- اجرای مدلهای بزرگتر
- پاسخگویی همزمان چند کاربر
- تولید تصویر یا ویدئو با مدلهای هوش مصنوعی
- فاینتیون مدلها
- پردازش حجم زیاد داده
در این شرایط فقط حجم مدل مهم نیست. سرعت انتقال داده بین حافظه و پردازنده گرافیکی، مقدار VRAM و سازگاری نرمافزارها هم روی عملکرد تأثیر دارند.
ممکن است یک مدل روی GPU با حافظه ناکافی اصلاً اجرا نشود یا مجبور شوید از نسخه کوچکتر آن استفاده کنید.
تفاوت سختافزار لازم برای اجرای مدل با آموزش و فاینتیون
یکی از اشتباهات رایج این است که اجرای مدل و آموزش مدل را یکسان بدانیم.
اجرای مدل (Inference) یعنی شما یک مدل آماده دارید و فقط از آن خروجی میگیرید. برای این کار معمولاً منابع کمتری لازم است.
آموزش (Training) یعنی مدل از ابتدا روی حجم زیادی داده آموزش داده شود. این فرایند به سختافزار بسیار قدرتمند، زمان طولانی و هزینه بالاتر نیاز دارد.
فاینتیون (Fine-tuning) بین این دو قرار میگیرد. در این روش یک مدل آماده را با دادههای اختصاصی تنظیم میکنید تا برای یک کاربرد خاص عملکرد بهتری داشته باشد.
برای مثال:
- اجرای یک مدل ۷ میلیارد پارامتری روی VPS ممکن است امکانپذیر باشد.
- اما آموزش همان مدل از ابتدا روی همان VPS عملاً منطقی نیست.
- فاینتیون نیز معمولاً به GPU، VRAM بیشتر و تنظیمات تخصصی نیاز دارد.
پس اگر هدف شما فقط استفاده از یک مدل آماده است، نیازی نیست هزینه زیرساخت آموزشی را پرداخت کنید.
سختافزار مورد نیاز برای نصب مدلهای هوش مصنوعی روی VPS

انتخاب سختافزار، مهمترین مرحله قبل از خرید VPS است. بسیاری از کاربران ابتدا سرور تهیه میکنند و بعد متوجه میشوند مدل موردنظرشان روی آن بهدرستی اجرا نمیشود.
برای انتخاب درست باید چند عامل را کنار هم بررسی کنید:
- اندازه مدل
- نوع نسخه مدل (اصلی یا کوانتیزه)
- تعداد کاربران
- طول درخواستها
- نیاز به GPU یا اجرای CPU
رم مورد نیاز؛ وزن مدل و حافظه مکالمه چقدر فضا میگیرند؟
رم مهمترین عامل برای اجرای مدل روی VPS است. فایل مدل فقط بخشی از حافظه مورد نیاز را مشخص میکند؛ هنگام اجرا، مدل باید در حافظه بارگذاری شود و فضای بیشتری برای پردازش نیاز دارد.
برای نمونه، یک مدل ۷ میلیارد پارامتری با نسخه کوانتیزه ممکن است چند گیگابایت حجم داشته باشد، اما اجرای واقعی آن به رم بیشتری نیاز دارد.
به همین دلیل پاسخ سؤال «برای اجرای مدل هوش مصنوعی روی VPS چقدر رم لازم است؟» به مدل انتخابی بستگی دارد.
یک تخمین عمومی:
| اندازه مدل | رم پیشنهادی برای اجرای ساده | کاربرد معمول |
| 1 تا 3 میلیارد پارامتر | 8 گیگابایت | آزمایش، چت ساده |
| 7 تا 8 میلیارد پارامتر کوانتیزه | 16 تا 32 گیگابایت | استفاده شخصی و تیم کوچک |
| 13 میلیارد پارامتر کوانتیزه | 32 گیگابایت به بالا | پاسخهای دقیقتر با منابع بیشتر |
| مدلهای بزرگتر | معمولاً نیازمند GPU | کاربردهای حرفهای |
این اعداد تقریبی هستند و عواملی مثل طول مکالمه، تعداد درخواستها و نرمافزارهای جانبی روی مصرف واقعی تأثیر میگذارند.
تعداد vCPU و تأثیر پردازنده اشتراکی یا اختصاصی
پردازنده در اجرای مدلهای بدون GPU نقش مهمی دارد. هرچه تعداد هستهها و قدرت پردازشی بیشتر باشد، تولید پاسخ سریعتر انجام میشود.
اما فقط تعداد vCPU روی کاغذ مهم نیست. در VPSهای اشتراکی ممکن است منابع پردازنده بین چند کاربر تقسیم شود و در زمان شلوغی عملکرد کاهش پیدا کند.
برای اجرای سبک، ۴ تا ۸ هسته پردازشی میتواند کافی باشد. برای استفاده مداوم یا کاربران بیشتر، بهتر است سروری با CPU اختصاصی یا منابع تضمینشده انتخاب شود.
حافظه گرافیکی یا VRAM و امکان جاگرفتن مدل روی GPU
در سرورهای GPU، مقدار VRAM یکی از مهمترین مشخصات است.
VRAM همان حافظه اختصاصی کارت گرافیک است که مدل هنگام اجرا از آن استفاده میکند. اگر مدل بزرگتر از ظرفیت VRAM باشد، ممکن است مجبور شوید بخشی از پردازش را به RAM منتقل کنید که معمولاً باعث کاهش سرعت میشود.
برای مثال، یک مدل ۷ یا ۸ میلیارد پارامتری کوانتیزه ممکن است روی GPUهای میانرده قابل اجرا باشد، اما مدلهای بزرگتر به کارتهایی با VRAM بالاتر نیاز دارند.
فضای دیسک برای مدلها، کانتینرها و دادههای برنامه
فضای ذخیرهسازی فقط برای فایل مدل نیست. روی VPS معمولاً این موارد هم فضا مصرف میکنند:
- سیستمعامل
- Ollama
- Docker و کانتینرها
- Open WebUI
- فایلهای لاگ
- نسخههای مختلف مدل
برای شروع، دیسک NVMe با حداقل ۵۰ تا ۱۰۰ گیگابایت فضای خالی انتخاب مناسبی است. اگر قصد نگهداری چند مدل را دارید، باید فضای بیشتری در نظر بگیرید.
تأثیر طول ورودی و تعداد کاربران همزمان بر منابع
بسیاری از کاربران هنگام انتخاب سرور فقط به حجم مدل توجه میکنند، درحالیکه طول مکالمه و تعداد درخواستها هم تأثیر زیادی روی منابع دارد. یک مدل ممکن است برای یک گفتوگوی کوتاه بهخوبی روی VPS اجرا شود، اما وقتی چند صفحه متن یا چند مکالمه طولانی وارد آن میکنید، مصرف RAM افزایش پیدا کند.
مدلهای زبانی برای نگهداری بخشهایی از مکالمه قبلی از مفهومی به نام Context Window یا پنجره زمینه استفاده میکنند. هرچه این مقدار بیشتر باشد، مدل میتواند متن بیشتری از گفتگو یا سند را همزمان در نظر بگیرد، اما حافظه بیشتری هم مصرف میشود.
برای مثال، یک چتبات داخلی که فقط به سؤالهای کوتاه پاسخ میدهد، فشار زیادی به سرور وارد نمیکند. اما مدلی که باید فایلهای طولانی را بررسی کند یا مکالمه چند ساعته را حفظ کند، به منابع بیشتری نیاز دارد.
تعداد کاربران هم همین اثر را دارد. اجرای مدل برای یک نفر با پاسخگویی به دهها درخواست همزمان شرایط کاملاً متفاوتی ایجاد میکند.
کوانتیزهسازی چیست و چگونه نیاز به حافظه را تغییر میدهد؟
کوانتیزهسازی (Quantization) روشی برای کاهش حجم مدلهای هوش مصنوعی است. در این روش، دقت برخی محاسبات کاهش پیدا میکند تا مدل فضای کمتری از RAM یا VRAM مصرف کند.
به بیان سادهتر، مدل به جای استفاده از اعداد با دقت بالا، از نمایش فشردهتر استفاده میکند. نتیجه این کار معمولاً کاهش مصرف حافظه و امکان اجرای مدل روی سختافزار ضعیفتر است.
البته کوانتیزهسازی بدون هزینه نیست. در بعضی مدلها ممکن است مقدار کمی از کیفیت پاسخ کاهش پیدا کند، مخصوصاً در وظایف پیچیده یا زبانهایی که مدل برای آنها داده آموزشی کمتری داشته است.
برای مثال، یک مدل ۸ میلیارد پارامتری ممکن است در نسخه اصلی به منابع زیادی نیاز داشته باشد، اما نسخه کوانتیزهشده همان مدل روی یک VPS با RAM کمتر قابل اجرا شود.
جدول سختافزار پیشنهادی برای اجرای مدلهای هوش مصنوعی روی VPS
اعداد این جدول فقط بر اساس حجم فایل مدل نیستند و فضای مورد نیاز هنگام اجرا، سیستمعامل، سرویسهای جانبی و شرایط استفاده معمول نیز در نظر گرفته شده است.
| سناریو | مدل و نسخه پیشنهادی | رم پیشنهادی | vCPU | GPU و VRAM | فضای دیسک | محدودیت عملی |
| آزمایش شخصی با یک کاربر | مدل ۳ تا ۷ میلیارد پارامتری کوانتیزه | ۸ تا ۱۶ گیگابایت | ۴ هسته | بدون GPU | ۵۰ گیگابایت NVMe | سرعت پاسخ محدود است |
| استفاده روزمره و مکالمه طولانیتر | مدل ۷ تا ۸ میلیارد پارامتری کوانتیزه مانند Qwen یا Llama | ۱۶ تا ۳۲ گیگابایت | ۸ هسته | GPU اختیاری | ۱۰۰ گیگابایت | طول ورودی روی سرعت اثر میگذارد |
| چند کاربر همزمان | مدل متوسط با بهینهسازی اجرا | ۳۲ گیگابایت به بالا | ۸ تا ۱۶ هسته | GPU با حداقل ۱۲ تا ۱۶ گیگابایت VRAM | ۱۵۰ گیگابایت به بالا | نیازمند آزمون بار است |
| سرویس تجاری | مدل بزرگتر یا چند مدل همزمان | ۶۴ گیگابایت به بالا | منابع اختصاصی | GPU حرفهای | متناسب با مدلها | هزینه زیرساخت افزایش پیدا میکند |
نکته مهم این است که هیچ عددی برای همه مدلها ثابت نیست. حتی دو مدل با تعداد پارامتر مشابه ممکن است مصرف حافظه متفاوتی داشته باشند.
هنگام خرید VPS برای هوش مصنوعی چه مواردی را بررسی کنیم؟

انتخاب VPS مناسب برای هوش مصنوعی فقط به عدد RAM و CPU محدود نمیشود. نوع سرویسدهنده، امکان مدیریت سرور، کیفیت سختافزار و محدودیتهای استفاده مداوم هم اهمیت دارند.
یک سرور ارزان ممکن است روی کاغذ مشخصات خوبی داشته باشد، اما اگر پردازنده اشتراکی ضعیف یا دیسک کند داشته باشد، تجربه اجرای مدل رضایتبخش نخواهد بود.
انتخاب سیستمعامل و معماری پردازنده
بیشتر ابزارهای اجرای مدلهای زبانی روی لینوکس عملکرد خوبی دارند. در بین توزیعهای مختلف، Ubuntu یکی از رایجترین گزینهها برای راهاندازی مدلهای هوش مصنوعی است.
برای مثال، نصب مدل هوش مصنوعی روی اوبونتو معمولاً به دلیل سازگاری مناسب با Docker، درایورهای GPU و ابزارهای خط فرمان سادهتر انجام میشود.
در انتخاب VPS بهتر است به معماری پردازنده هم توجه کنید. بیشتر مدلهای رایج برای معماری x86_64 بهینه شدهاند، بنابراین هنگام خرید سرور باید مطمئن شوید محیط انتخابی با نرمافزارهای مورد نیاز سازگار است.
دسترسی مدیریتی و امکان نصب Docker
برای نصب ابزارهایی مانند Ollama و Open WebUI معمولاً به دسترسی مدیریتی نیاز دارید.
داشتن دسترسی Root یا sudo اجازه میدهد:
- نرمافزارهای مورد نیاز نصب شوند.
- سرویسها مدیریت شوند.
- پورتها تنظیم شوند.
- کانتینرهای Docker اجرا شوند.
Docker نیز یکی از ابزارهای پرکاربرد در راهاندازی سرویسهای هوش مصنوعی است. با استفاده از کانتینرها میتوان برنامههایی مانند Open WebUI را جدا از سیستم اصلی اجرا کرد و مدیریت آنها را سادهتر کرد.
منابع تضمینشده و محدودیت مصرف مداوم CPU
اجرای مدل هوش مصنوعی معمولاً برخلاف سایتهای معمولی، فشار پردازشی مداوم ایجاد میکند.
در برخی VPSها ممکن است نوشته شود که سرور دارای چند هسته CPU است، اما این منابع بین چند کاربر مشترک باشند. در چنین شرایطی، هنگام افزایش مصرف دیگر کاربران، سرعت مدل شما هم کاهش پیدا میکند.
برای استفاده جدیتر بهتر است سروری انتخاب شود که منابع پردازشی مشخص و پایدار ارائه دهد.
مرتبط: آیفون میتواند مدلهای هوش مصنوعی را با ۱۴ میلیارد پارامتر فعال اجرا کند
نوع GPU، حافظه اختصاصی و سازگاری درایور
اگر قصد استفاده از GPU دارید، فقط نام کارت گرافیک کافی نیست. باید موارد زیر را بررسی کنید:
- مقدار VRAM
- مدل GPU
- پشتیبانی از CUDA
- نسخه درایور
- سازگاری با کتابخانههای هوش مصنوعی
برای مثال، ممکن است یک GPU قدرت پردازشی مناسبی داشته باشد اما به دلیل VRAM کم نتواند مدل موردنظر شما را اجرا کند.
پهنای باند، فضای ذخیرهسازی و هزینه نهایی
مدلهای هوش مصنوعی حجم کمی ندارند. دانلود یک مدل چند گیگابایتی، ذخیره چند نسخه مختلف و نگهداری فایلهای برنامه نیازمند فضای مناسب است.
هنگام خرید VPS بهتر است این موارد را بررسی کنید:
- سرعت دیسک (ترجیحاً NVMe)
- میزان ترافیک ماهانه
- هزینه افزایش منابع
- امکان ارتقا در آینده
- هزینه پشتیبانگیری
گاهی یک VPS کمی گرانتر که امکان ارتقا دارد، در عمل هزینه کمتری نسبت به مهاجرت کامل به سرور جدید ایجاد میکند.
انتخاب مدل مناسب برای منابع سرور

بعد از انتخاب VPS، مرحله بعد انتخاب مدل مناسب است. بزرگتر بودن مدل همیشه به معنی بهتر بودن نتیجه نیست.
یک مدل بزرگ که روی سرور شما کند اجرا شود، ممکن است تجربه بدتری نسبت به یک مدل کوچکتر اما سریعتر ایجاد کند.
انتخاب اندازه مدل متناسب با RAM و VRAM
مدلهای زبانی معمولاً با تعداد پارامتر معرفی میشوند. تعداد پارامتر بیشتر معمولاً به معنی توانایی بالاتر مدل است، اما نیاز سختافزاری بیشتری هم ایجاد میکند.
برای شروع بهتر است مدل را بر اساس هدف انتخاب کنید:
- کارهای ساده متنی → مدلهای کوچک
- چت عمومی و خلاصهسازی → مدلهای متوسط
- تحلیل تخصصی و استفاده تجاری → مدلهای بزرگتر
برای یک VPS معمولی، مدلهای ۷ تا ۸ میلیارد پارامتری کوانتیزه معمولاً نقطه شروع مناسبی هستند.
بررسی کیفیت فارسی و کاربرد موردنظر
همه مدلها در زبان فارسی عملکرد یکسانی ندارند. بعضی مدلها برای زبانهای مختلف آموزش بهتری دیدهاند و پاسخهای طبیعیتری تولید میکنند.
اگر هدف شما اجرای مدل فارسی روی VPS است، فقط به حجم مدل نگاه نکنید. کیفیت دادههای آموزشی، توانایی درک فارسی و عملکرد مدل در آزمایشهای واقعی مهمتر است.
برای مثال، مدلی که در انگلیسی عالی عمل میکند ممکن است در پاسخهای فارسی، اصطلاحات را اشتباه ترجمه کند یا جملهبندی طبیعی نداشته باشد.
انتخاب نسخه کوانتیزه و طول زمینه مناسب
هنگام دانلود مدل معمولاً نسخههای مختلفی وجود دارد. نسخههای کوانتیزهشده برای اجرا روی سختافزار محدود مناسبتر هستند.
همچنین باید طول زمینه مدل را بررسی کنید. اگر هدف شما تحلیل اسناد طولانی است، مدلی با Context Window بزرگتر انتخاب بهتری خواهد بود؛ البته به منابع بیشتری نیاز دارد.
بررسی مجوز استفاده از مدل
هر مدل هوش مصنوعی شرایط استفاده خاص خود را دارد. بعضی مدلها برای استفاده تجاری آزاد هستند و بعضی دیگر محدودیتهایی دارند.
قبل از استفاده در محصول یا سرویس عمومی، مجوز مدل را بررسی کنید تا در آینده با مشکل حقوقی یا محدودیت استفاده مواجه نشوید.
آمادهسازی VPS اوبونتو پیش از نصب

قبل از اینکه سراغ نصب مدل هوش مصنوعی روی VPS بروید، بهتر است محیط سرور را آماده کنید. بسیاری از خطاهایی که هنگام نصب Ollama یا ابزارهای جانبی دیده میشوند، به دلیل آماده نبودن سیستمعامل، کمبود منابع یا تنظیمات اشتباه سرور اتفاق میافتند.
در این بخش، یک VPS با سیستمعامل Ubuntu 24.04 LTS را برای اجرای مدل آماده میکنیم. دستورهایی که در ادامه میبینید برای یک سرور لینوکسی تازه نصبشده نوشته شدهاند.
سناریوی آزمایشی مقاله:
- سیستمعامل: Ubuntu 24.04 LTS
- پردازنده: 8 vCPU
- رم: 32GB
- فضای ذخیرهسازی: 100GB NVMe
- مدل آزمایشی: Qwen2.5 7B نسخه کوانتیزه
- روش اجرا: Ollama
این مشخصات برای آزمایش اجرای مدل زبانی، ساخت API و راهاندازی رابط وب مناسب است، اما برای سرویسهای پرترافیک باید منابع بیشتری در نظر گرفته شود.
اتصال به سرور با SSH
اولین مرحله برای مدیریت VPS، اتصال از طریق SSH است. SSH یک پروتکل امن برای کنترل سرور از راه دور است و معمولاً بدون نیاز به نصب نرمافزارهای گرافیکی انجام میشود.
در سیستمهای ویندوز، مک و لینوکس میتوانید از ابزارهای مختلف SSH استفاده کنید. در لینوکس و مک معمولاً ابزار SSH بهصورت پیشفرض وجود دارد.
برای اتصال، دستور زیر را اجرا کنید:
ssh username@server_ip
به جای username نام کاربری سرور و به جای server_ip آدرس IP VPS را وارد کنید.
پس از اتصال موفق، تمام دستورهای نصب و تنظیمات از همین محیط انجام میشوند.
مرتبط: تنسنت رقیب تازهنفسی برای مدلهای هوش مصنوعی کدنویسی معرفی کرد
بهروزرسانی سیستم و ساخت کاربر مناسب
قبل از نصب ابزارهای هوش مصنوعی بهتر است بستههای سیستمعامل را بهروزرسانی کنید.
ابتدا فهرست بستهها را دریافت کنید:
sudo apt update
سپس سیستم را به آخرین نسخه بستههای نصبشده ارتقا دهید:
sudo apt upgrade -y
این مرحله شاید ساده به نظر برسد، اما استفاده از بستههای قدیمی میتواند باعث ناسازگاری بین Ollama، Docker یا کتابخانههای مورد نیاز شود.
برای مدیریت بهتر، بهتر است اجرای سرویسها را فقط با کاربر اصلی Root انجام ندهید. ساخت یک کاربر جداگانه با دسترسی محدود، امنیت سرور را افزایش میدهد.
برای ساخت کاربر جدید:
sudo adduser aiuser
سپس دسترسی sudo را به آن اضافه کنید:
sudo usermod -aG sudo aiuser
بررسی CPU، RAM و فضای دیسک
قبل از نصب مدل، باید مطمئن شوید منابع واقعی VPS با مشخصات خریداریشده هماهنگ است.
برای بررسی پردازنده:
lscpu
این دستور اطلاعاتی مانند تعداد هستهها و معماری پردازنده را نمایش میدهد.
برای بررسی مقدار RAM:
free -h
خروجی مشابه زیر مشاهده خواهید کرد:
total
Mem: 31Gi
برای بررسی فضای دیسک:
df -h
مدلهای هوش مصنوعی معمولاً چند گیگابایت فضا نیاز دارند. اگر قصد نصب چند مدل یا نگهداری نسخههای مختلف را دارید، باید فضای بیشتری در نظر بگیرید.
بررسی GPU و نصب درایور در سرورهای مجهز
اگر VPS شما دارای GPU است، قبل از نصب مدل باید مطمئن شوید کارت گرافیک بهدرستی شناسایی میشود.
برای کارتهای NVIDIA معمولاً از دستور زیر استفاده میشود:
nvidia-smi
اگر درایور درست نصب شده باشد، اطلاعاتی مانند مدل GPU، مقدار VRAM و میزان مصرف حافظه نمایش داده میشود.
نمونه خروجی:
GPU Name Memory Usage
RTX 4090 0MiB / 24564MiB
اگر دستور اجرا نشد یا GPU نمایش داده نشد، معمولاً مشکل از نصب نبودن درایور یا ناسازگاری محیط سرور است.
نکته مهم این است که داشتن GPU روی مشخصات VPS بهتنهایی کافی نیست. باید درایور، CUDA و ابزارهای مورد نیاز هم بهدرستی تنظیم شوند.
آموزش نصب Ollama روی VPS

Ollama یکی از سادهترین ابزارها برای اجرای مدلهای زبانی روی سرور شخصی است. این ابزار مدیریت مدل، دانلود فایلها و اجرای آنها را ساده میکند و امکان استفاده از مدلهایی مانند Llama، Qwen و مدلهای دیگر را فراهم میکند.
مزیت اصلی Ollama این است که لازم نیست تمام مراحل پیچیده آمادهسازی محیط اجرای مدل را بهصورت دستی انجام دهید.
نصب Ollama و بررسی وضعیت سرویس
برای نصب Ollama روی سرور مجازی اوبونتو، ابتدا دستور نصب رسمی را اجرا کنید:
curl -fsSL https://ollama.com/install.sh | sh
پس از پایان نصب، وضعیت سرویس را بررسی کنید:
systemctl status ollama
اگر سرویس فعال باشد، خروجی مشابه زیر مشاهده میکنید:
Active: active (running)
برای فعال شدن خودکار Ollama بعد از ریاستارت سرور:
sudo systemctl enable ollama
حالا محیط اجرای مدل آماده است.
دانلود مدل انتخابشده
بعد از نصب Ollama باید مدل موردنظر را دانلود کنید.
برای مثال، دانلود مدل Qwen:
ollama pull qwen2.5:7b
یا اجرای مدل:
ollama run qwen2.5:7b
در اولین اجرا، Ollama فایل مدل را دریافت و روی سرور ذخیره میکند.
حجم دانلود به مدل و نسخه انتخابشده بستگی دارد. مدلهای بزرگتر فضای بیشتری مصرف میکنند و زمان دانلود آنها هم بیشتر است.
اجرای اولین درخواست و آزمایش پاسخ فارسی
بعد از اجرای مدل میتوانید یک سؤال آزمایشی ارسال کنید:
سلام، خودت را معرفی کن.
اگر مدل پاسخ مناسب تولید کرد، یعنی مراحل اولیه نصب موفق بوده است.
برای آزمایش زبان فارسی میتوانید سؤالهای مختلفی بپرسید:
یک متن کوتاه درباره مزایای استفاده از انرژی خورشیدی بنویس.
اما توجه داشته باشید که کیفیت پاسخ فارسی فقط به نصب درست مدل مربوط نیست. انتخاب مدل مناسب برای زبان فارسی نیز اهمیت زیادی دارد.
بررسی اینکه مدل از CPU یا GPU استفاده میکند
بعد از اجرای مدل بهتر است بررسی کنید که پردازش واقعاً روی کدام سختافزار انجام میشود.
در سرورهای بدون GPU، تمام پردازش روی CPU انجام میشود. این حالت برای مدلهای کوچک و استفاده محدود قابل قبول است، اما سرعت پاسخ پایینتر خواهد بود.
در سرورهای NVIDIA میتوانید هنگام اجرای مدل دستور زیر را بررسی کنید:
nvidia-smi
اگر مدل از GPU استفاده کند، میزان مصرف VRAM افزایش پیدا میکند.
نکته مهم این است که اجرای مدل روی GPU همیشه خودکار نیست. تنظیمات Ollama، درایور و سازگاری سختافزار باید درست باشد.
چگونه از کامپیوتر خود به مدل روی VPS وصل شویم؟

بعد از نصب مدل، معمولاً فقط استفاده مستقیم از ترمینال کافی نیست. در بسیاری از پروژهها نیاز دارید یک برنامه دیگر، سایت یا نرمافزار داخلی به مدل متصل شود.
برای این کار باید دسترسی به مدل را از طریق API فراهم کنید.
دسترسی خصوصی با تونل SSH
باز کردن مستقیم پورت مدل روی اینترنت همیشه انتخاب مناسبی نیست. یکی از روشهای امنتر استفاده از تونل SSH است.
در این روش، اتصال بین کامپیوتر شما و سرور از طریق یک مسیر رمزگذاریشده انجام میشود.
مزیت این روش:
- نیازی به عمومی کردن API نیست.
- افراد دیگر نمیتوانند به مدل دسترسی داشته باشند.
- برای آزمایش و توسعه بسیار مناسب است.
ارسال درخواست به API مدل
Ollama بهصورت داخلی یک API ارائه میدهد که برنامهها میتوانند از طریق آن با مدل ارتباط برقرار کنند.
برای نمونه، درخواست به API میتواند شامل این اطلاعات باشد:
- نام مدل
- متن ورودی
- تنظیمات تولید پاسخ
نمونه ساختار درخواست:
{
“model”: “qwen2.5:7b”,
“prompt”: “یک متن درباره هوش مصنوعی بنویس”
}
به این شکل، یک سایت، اپلیکیشن یا سیستم داخلی میتواند بدون باز کردن محیط Ollama، از مدل استفاده کند.
آزمایش اتصال و دریافت پاسخ
بعد از فعال شدن API باید اتصال را بررسی کنید.
یک تست ساده با درخواست HTTP انجام میشود تا مطمئن شوید:
- سرویس فعال است.
- مدل بارگذاری میشود.
- پاسخ به برنامه ارسال میشود.
اگر پاسخ دریافت نشد، معمولاً مشکل از یکی از این موارد است:
- سرویس Ollama فعال نیست.
- پورت موردنظر بسته است.
- فایروال دسترسی را محدود کرده است.
- مدل روی سرور دانلود نشده است.
مرتبط: آموزش اجرای مدلهای هوش مصنوعی روی گوشی اندرویدی با MNN Chat
نصب Open WebUI برای گفتوگو با مدل در مرورگر

استفاده از مدل هوش مصنوعی فقط از طریق خط فرمان برای بسیاری از کاربران راحت نیست. اگر بخواهید تجربهای شبیه ابزارهای چت هوش مصنوعی داشته باشید، میتوانید یک رابط وب روی VPS نصب کنید.
Open WebUI یکی از ابزارهای محبوب برای این کار است که یک محیط گرافیکی برای ارتباط با مدلهای اجراشده در Ollama فراهم میکند. با نصب آن، کاربران میتوانند از طریق مرورگر سؤال بپرسند، مکالمههای قبلی را مشاهده کنند و مدلهای مختلف را مدیریت کنند.
در این بخش، Open WebUI را روی همان VPS اوبونتو و در کنار Ollama راهاندازی میکنیم.
راهاندازی رابط وب و اتصال به Ollama
یکی از سادهترین روشهای نصب Open WebUI استفاده از Docker است. اگر Docker روی سرور نصب نیست، ابتدا آن را نصب کنید.
ابتدا بستههای مورد نیاز را دریافت کنید:
sudo apt update
سپس Docker را نصب کنید:
sudo apt install docker.io -y
برای اطمینان از نصب صحیح:
docker –version
حالا میتوانیم کانتینر Open WebUI را اجرا کنیم:
docker run -d \
-p 3000:8080 \
–add-host=host.docker.internal:host-gateway \
-v open-webui:/app/backend/data \
–name open-webui \
–restart always \
ghcr.io/open-webui/open-webui:main
در این دستور:
- پورت 3000 برای دسترسی مرورگر استفاده میشود.
- اطلاعات کاربران و تنظیمات در یک Volume ذخیره میشود.
- گزینه restart always باعث میشود بعد از راهاندازی مجدد سرور، سرویس دوباره فعال شود.
بعد از اجرای موفق کانتینر، با وارد کردن آدرس زیر در مرورگر میتوانید رابط وب را باز کنید:
http://SERVER_IP:3000
اگر همه چیز درست باشد، صفحه ورود Open WebUI نمایش داده میشود.
تنظیم حساب کاربری و محدودکردن ثبتنام
باز گذاشتن صفحه ثبتنام عمومی روی یک سرور متصل به اینترنت میتواند مشکل امنیتی ایجاد کند. هر فردی که به صفحه دسترسی داشته باشد، ممکن است بتواند از منابع سرور شما استفاده کند.
بهتر است:
- ثبتنام عمومی را غیرفعال کنید.
- فقط کاربران مشخص اجازه ورود داشته باشند.
- برای حسابها رمز عبور قوی انتخاب کنید.
این موضوع زمانی اهمیت بیشتری پیدا میکند که مدل روی VPS بدون محدودیت عمومی در دسترس باشد؛ چون هر درخواست پردازشی از مدل، منابع CPU یا GPU مصرف میکند.
ذخیره پایدار تنظیمات و مکالمهها
وقتی Open WebUI را در Docker اجرا میکنید، اطلاعات داخل کانتینر ذخیره نمیشود مگر اینکه فضای ذخیرهسازی دائمی تعریف کرده باشید.
در دستور نصب قبلی:
-v open-webui:/app/backend/data
باعث میشود اطلاعات مهم در Volume جداگانه ذخیره شوند.
این اطلاعات شامل مواردی مانند:
- تنظیمات برنامه
- حسابهای کاربری
- تاریخچه مکالمهها
- تنظیمات مدلها
است.
البته نگهداری مکالمهها به فضای دیسک نیاز دارد. اگر کاربران زیادی از سیستم استفاده کنند، بهتر است برای مدیریت حجم دادهها برنامه مشخصی داشته باشید.
اتصال دامنه و فعالکردن HTTPS در صورت نیاز
برای استفاده شخصی، باز کردن Open WebUI با IP سرور کافی است. اما اگر قرار است دیگران از سیستم استفاده کنند، بهتر است یک دامنه به آن متصل کنید.
ساختار معمول:
ai.example.com
سپس میتوان از ابزارهایی مانند Nginx بهعنوان Reverse Proxy استفاده کرد تا:
- اتصال HTTPS فعال شود.
- گواهی SSL نصب شود.
- دسترسیها بهتر مدیریت شوند.
داشتن HTTPS فقط برای ظاهر حرفهای نیست. اطلاعات مکالمهها ممکن است شامل دادههای حساس باشد و انتقال رمزگذارینشده آنها ریسک امنیتی ایجاد میکند.
ایمنسازی سرور و کنترل دسترسی به مدل

نصب موفق مدل فقط پایان کار نیست. اگر سرور به اینترنت متصل باشد، باید دسترسیها را مدیریت کنید.
یک مدل هوش مصنوعی روی VPS شبیه یک سرویس پردازشی است؛ اگر بدون محدودیت در اختیار همه قرار بگیرد، ممکن است منابع سرور خیلی سریع مصرف شوند.
جلوگیری از دسترسی عمومی بدون احراز هویت به API
یکی از اشتباهات رایج این است که API مدل را مستقیماً روی اینترنت منتشر کنیم.
برای مثال، اگر API بدون محافظت در دسترس باشد، هر فردی میتواند درخواست ارسال کند و باعث افزایش مصرف CPU یا GPU شود.
راهکارهای مناسب:
- استفاده از احراز هویت
- محدود کردن IPهای مجاز
- استفاده از Reverse Proxy
- قرار دادن API پشت VPN در پروژههای داخلی
تنظیم فایروال و بازکردن پورتهای ضروری
در یک VPS معمولاً لازم نیست همه پورتها باز باشند.
برای مدیریت دسترسی میتوانید از UFW در اوبونتو استفاده کنید.
بررسی وضعیت:
sudo ufw status
فعالسازی:
sudo ufw enable
باز کردن SSH:
sudo ufw allow 22
باز کردن پورت Open WebUI:
sudo ufw allow 3000
بهتر است فقط پورتهایی باز باشند که واقعاً به آنها نیاز دارید.
محدودکردن درخواستها و تعداد کاربران
اگر مدل قرار است توسط چند نفر استفاده شود، باید برای مصرف منابع محدودیت ایجاد کنید.
برخی راهکارها:
- محدود کردن تعداد درخواست در دقیقه
- تعیین سقف کاربران همزمان
- محدود کردن طول ورودی
- استفاده از صف پردازش
برای مثال، یک VPS که برای یک کاربر مناسب است، ممکن است با پنج کاربر همزمان دچار کاهش شدید سرعت شود.
مرتبط: مروگر کروم برای دانلود مدلهای هوش مصنوعی به ۲۰ گیگابایت فضا نیاز دارد
مدیریت لاگها، مکالمهها و نسخه پشتیبان
لاگها برای پیدا کردن خطاها مفید هستند، اما اگر کنترل نشوند میتوانند فضای دیسک را پر کنند.
بهتر است:
- لاگهای قدیمی پاک شوند.
- از تنظیمات Open WebUI نسخه پشتیبان گرفته شود.
- مدلهای مهم دوباره قابل دانلود یا انتقال باشند.
- اطلاعات حساس کاربران ذخیره نشوند یا رمزگذاری شوند.
پشتیبانگیری فقط برای مواقع خرابی نیست؛ هنگام ارتقای VPS یا انتقال به سرور جدید هم کاربرد دارد.
آزمایش عملکرد مدل روی VPS؛ آیا سرور انتخابشده کافی است؟

بعد از نصب مدل، نباید فقط به این دلیل که پاسخ دریافت میکنید، نتیجه بگیرید سرور مناسب است.
یک مدل ممکن است روی VPS اجرا شود اما سرعت آن برای استفاده واقعی پایین باشد. به همین دلیل باید چند آزمایش ساده انجام دهید.
اندازهگیری زمان اولین پاسخ و سرعت تولید متن
یکی از معیارهای مهم، زمان دریافت اولین بخش پاسخ است.
دو مورد را باید بررسی کنید:
- زمان شروع پاسخ پس از ارسال سؤال
- سرعت تولید ادامه متن
برای مثال، ممکن است یک مدل کوچک سریع شروع به پاسخ کند، اما مدل بزرگتر با تأخیر بیشتری شروع شود و در ادامه کیفیت بالاتری ارائه دهد.
انتخاب نهایی باید بر اساس نیاز واقعی باشد.
ثبت مصرف RAM، CPU و VRAM
هنگام اجرای مدل، میزان مصرف منابع را بررسی کنید.
برای CPU و RAM:
htop
برای GPU:
nvidia-smi
این بررسی نشان میدهد آیا سرور فضای کافی برای اجرای پایدار مدل دارد یا خیر.
اگر مصرف RAM همیشه نزدیک به سقف باشد، احتمال توقف مدل یا کاهش سرعت وجود دارد.
آزمایش با ورودی طولانی و درخواستهای همزمان
یک تست واقعی فقط با یک سؤال کوتاه انجام نمیشود.
بهتر است مدل را با شرایط نزدیک به استفاده واقعی بررسی کنید:
- متن طولانی وارد کنید.
- چند درخواست پشت سر هم ارسال کنید.
- چند کاربر همزمان را شبیهسازی کنید.
این آزمایشها مشخص میکنند که آیا VPS فعلی کافی است یا باید منابع را افزایش دهید.
تصمیمگیری بین مدل کوچکتر و ارتقای سرور
گاهی بهترین راهحل خرید سرور قویتر نیست.
اگر یک مدل بزرگ روی VPS کند اجرا میشود، ممکن است استفاده از نسخه کوچکتر یا کوانتیزهشده نتیجه بهتری بدهد.
مثلاً:
- مدل کوچکتر → سرعت بیشتر و هزینه کمتر
- مدل بزرگتر → کیفیت بالاتر اما نیازمند منابع بیشتر
انتخاب باید بر اساس کاربرد انجام شود، نه صرفاً تعداد پارامترهای مدل.
خطاهای رایج نصب مدل هوش مصنوعی روی سرور

نصب مدل هوش مصنوعی روی VPS معمولاً پیچیدگی زیادی ندارد، اما در عمل بعضی خطاها باعث میشوند مدل اجرا نشود، سرعت پاسخ پایین باشد یا سرویس بعد از مدتی از دسترس خارج شود.
بیشتر این مشکلات به سه دلیل اتفاق میافتند: انتخاب سختافزار نامناسب، تنظیمات اشتباه نرمافزاری یا مدیریت نکردن منابع سرور.
شناخت خطاهای رایج کمک میکند قبل از صرف هزینه برای ارتقای سرور، دلیل واقعی مشکل را پیدا کنید.
کمبود حافظه و متوقفشدن مدل
یکی از رایجترین مشکلات هنگام اجرای مدلهای زبانی، کمبود RAM یا VRAM است.
ممکن است مدل دانلود شود و حتی دستور اجرا هم بدون خطا شروع شود، اما هنگام بارگذاری کامل، سرویس متوقف شود یا سرور با کاهش شدید سرعت مواجه شود.
علائم کمبود حافظه:
- بسته شدن ناگهانی مدل
- خطای Out of Memory
- افزایش شدید مصرف Swap
- کند شدن کل سرور
برای رفع این مشکل چند راه وجود دارد:
- استفاده از نسخه کوانتیزه مدل
- انتخاب مدل کوچکتر
- افزایش RAM سرور
- استفاده از GPU با VRAM بیشتر
برای مثال، اگر یک مدل ۱۴ میلیارد پارامتری روی VPS با رم محدود اجرا نمیشود، لزوماً مشکل از نصب Ollama نیست؛ ممکن است منابع سرور برای آن مدل کافی نباشد.
شناسایینشدن GPU
در سرورهای مجهز به GPU، یکی از مشکلات رایج این است که مدل همچنان با CPU اجرا میشود.
داشتن کارت گرافیک روی مشخصات VPS به این معنی نیست که سیستمعامل حتماً آن را شناخته است.
دلایل احتمالی:
- نصب نبودن درایور NVIDIA
- ناسازگاری نسخه CUDA
- تنظیمات اشتباه Docker
- اختصاص داده نشدن GPU به کانتینر
برای بررسی اولیه میتوانید از دستور زیر استفاده کنید:
nvidia-smi
اگر اطلاعات کارت گرافیک نمایش داده نشد، ابتدا باید مشکل درایور یا دسترسی GPU بررسی شود.
نکته مهم این است که استفاده از GPU باید در عمل بررسی شود. ممکن است سرور GPU داشته باشد، اما مدل به دلیل تنظیمات اشتباه همچنان روی CPU پردازش شود.
کندی پاسخ روی VPS معمولی
گاهی مدل بدون هیچ خطایی اجرا میشود، اما سرعت آن رضایتبخش نیست.
این اتفاق بیشتر در VPSهای بدون GPU دیده میشود. اجرای هوش مصنوعی روی سرور بدون GPU برای بعضی کاربردها مناسب است، اما محدودیت سرعت دارد.
عوامل مؤثر بر سرعت:
- تعداد هستههای CPU
- فرکانس پردازنده
- سرعت RAM
- نوع مدل
- حجم درخواست
- تعداد کاربران همزمان
برای مثال، یک مدل ۷ میلیارد پارامتری ممکن است روی VPS شخصی برای پاسخهای کوتاه مناسب باشد، اما برای یک چتبات عمومی با کاربران زیاد تجربه خوبی ایجاد نکند.
در چنین شرایطی سه انتخاب دارید:
- مدل کوچکتر انتخاب کنید.
- منابع VPS را افزایش دهید.
- به سرور GPU مهاجرت کنید.
خطای اتصال Open WebUI به Ollama
یکی از مشکلات رایج بعد از نصب Open WebUI این است که رابط وب اجرا میشود، اما مدلها را نمایش نمیدهد.
معمولاً دلیل این مشکل ارتباط نادرست بین Open WebUI و Ollama است.
مواردی که باید بررسی شوند:
- فعال بودن سرویس Ollama
- درست بودن آدرس API
- دسترسی کانتینر Docker به سرویس Ollama
- باز بودن پورتهای لازم
برای بررسی وضعیت Ollama:
systemctl status ollama
همچنین بررسی کنید مدل موردنظر روی سرور وجود داشته باشد:
ollama list
اگر مدل در فهرست وجود ندارد، ابتدا باید آن را دانلود کنید.
مرتبط: شرکت OpenAI قیمت مدلهای هوش مصنوعی GPT-5.6 Luna و Terra را کاهش داد
پرشدن دیسک یا ناقصماندن دانلود مدل
مدلهای هوش مصنوعی حجم قابل توجهی دارند. یکی از خطاهایی که معمولاً در شروع کار دیده میشود، کمبود فضای دیسک هنگام دانلود مدل است.
علائم این مشکل:
- توقف دانلود مدل
- خطای ذخیره فایل
- اجرا نشدن مدل پس از دانلود
- کاهش فضای آزاد سرور
برای بررسی فضای دیسک:
df -h
برای جلوگیری از این مشکل:
- قبل از دانلود مدل فضای خالی را بررسی کنید.
- مدلهای غیرضروری را حذف کنید.
- فایلهای موقت و لاگهای قدیمی را مدیریت کنید.
اجرای مدل روی VPS چقدر هزینه دارد؟

هزینه راهاندازی مدل هوش مصنوعی روی VPS به عوامل مختلفی بستگی دارد. نوع مدل، میزان استفاده، نیاز به GPU و تعداد کاربران تعیین میکنند که چه سروری مناسب است.
نمیتوان یک قیمت ثابت برای همه پروژهها اعلام کرد، چون اجرای یک مدل سبک برای استفاده شخصی با ساخت یک سرویس عمومی تفاوت زیادی دارد.
هزینه سرور، GPU، دیسک و پشتیبانگیری
هزینه اصلی معمولاً مربوط به خود سرور است.
مواردی که روی هزینه تأثیر میگذارند:
- مقدار RAM
- تعداد هسته CPU
- نوع دیسک
- داشتن یا نداشتن GPU
- میزان ترافیک
- فضای پشتیبانگیری
یک VPS بدون GPU معمولاً هزینه کمتری دارد و برای آزمایش یا استفاده محدود مناسب است.
در مقابل، سرور GPU به دلیل هزینه بالاتر کارت گرافیک و VRAM معمولاً چند برابر گرانتر است.
مقایسه هزینه اجرای دائمی با استفاده از API آماده
قبل از خرید VPS بهتر است بررسی کنید که میزبانی شخصی واقعاً برای شما بهصرفه است یا خیر.
اجرای مدل روی سرور شخصی مزایایی دارد:
- کنترل کامل روی دادهها
- امکان شخصیسازی مدل
- عدم وابستگی دائمی به سرویس خارجی
اما هزینههایی هم دارد:
- اجاره VPS
- نگهداری سرور
- بهروزرسانی نرمافزارها
- مدیریت امنیت
در مقابل، استفاده از API آماده معمولاً شروع سادهتری دارد و برای پروژههایی که مصرف کمی دارند، ممکن است گزینه مناسبتری باشد.
چه میزان استفاده، میزبانی شخصی را توجیه میکند؟
میزبانی مدل روی VPS زمانی ارزش بیشتری پیدا میکند که استفاده شما مداوم باشد.
برای مثال:
- یک شرکت که روزانه صدها درخواست داخلی دارد.
- تیمی که میخواهد دادههای خود را روی سرور خودش نگه دارد.
- توسعهدهندهای که چند پروژه مبتنی بر مدل زبانی دارد.
اما اگر فقط گاهی چند سؤال از مدل میپرسید، خرید VPS دائمی ممکن است هزینه اضافی ایجاد کند.
این سرور برای چه کاری مناسب است؟
جدول زیر یک دید کلی برای انتخاب سرور مناسب هوش مصنوعی ارائه میدهد:
| نوع استفاده | مشخصات پیشنهادی | مناسب برای | محدودیت |
| آزمایش و یادگیری | 8GB RAM، 4 vCPU، بدون GPU | تست مدلهای کوچک | سرعت پایینتر |
| استفاده شخصی و تیم کوچک | 16 تا 32GB RAM، 8 vCPU | چتبات داخلی، تولید متن | کاربران محدود |
| سرویس چندکاربره | 32GB RAM به بالا، CPU قوی یا GPU متوسط | API و کاربران همزمان | نیازمند مدیریت منابع |
| پروژه تجاری سنگین | GPU اختصاصی، VRAM بالا، منابع اختصاصی | سرویس عمومی و مدلهای بزرگ | هزینه بیشتر |
سؤالات متداول
بله. بسیاری از مدلهای کوچک و متوسط با نسخه کوانتیزه روی VPS بدون GPU اجرا میشوند، اما سرعت پاسخ معمولاً کمتر از سرورهای مجهز به GPU است.
برای بعضی مدلهای کوچک و آزمایشهای اولیه کافی است، اما برای مدلهای رایج ۷ یا ۸ میلیارد پارامتری معمولاً رم بیشتری پیشنهاد میشود.
تعداد کاربران به مدل، سختافزار و نوع درخواستها بستگی دارد. یک VPS مناسب استفاده شخصی ممکن است برای چند کاربر همزمان کافی نباشد.
بله، اما باید فضای دیسک و RAM کافی داشته باشید. نصب چند مدل بزرگ روی یک سرور کوچک باعث کاهش سرعت یا خطای کمبود حافظه میشود.
بله، اگر Ollama بهصورت سرویس اجرا شده باشد یا از ابزارهایی مانند Docker و systemd استفاده کنید، قطع شدن اتصال SSH باعث توقف مدل نمیشود.

















