صفر تا صد آموزش سینا؛ از پرسونا تا Fine-tune روی لپتاپ
سینا چطور یاد میگیرد: دانشنامه RAG، حافظه تجربیات متخصصان، و Fine-tune روی Qwen2.5-3B-Instruct با کارت RTX 4060.

میز سینا · ۱۴۰۵/۰۵/۳۱
سینا دستیار هوشمند رسمی شرکت ساینا ارتباط است؛ سیمرغ دیجیتال سازمان، نه یک چتبات عمومی بدون هویت. مالک و مدیرعامل شهرام علینژاد است. دامنه سینا فناوری است: شبکه، سیسکو، مایکروسافت، برنامهنویسی امن، DevOps و امنیت دفاعی. سینا وکیل نیست و داده داخلی میزکار را فاش نمیکند.
آموزش سینا سه لایه جدا دارد و این تفکیک مهم است. لایه اول پرسوناست: دستور سیستمی که لحن، اخلاق و قالب جواب را ثابت میکند. لایه دوم دانشنامه بازیابیشده یا RAG است: مقالات، دروس تخصصی، مستند فروشنده و تجربیات ثبتشده. لایه سوم Fine-tune یا LoRA است که وزن مدل را تکان میدهد تا لحن سازمانی در خود مدل بنشیند. روی سرور تولید امروز لایه اول و دوم زنده است؛ لایه سوم روی لپتاپ آموزش داده میشود و تا ارزیابی و بارگذاری، وارد پاسخ زنده نمیشود.
مدل پایهای که برای آموزش روی لپتاپ انتخاب شده Qwen2.5-3B-Instruct است. دلیل انتخاب ساده است: کارت RTX 4060 با ۸ گیگابایت حافظه این مدل را با QLoRA چهاربیتی جا میدهد، فارسی را بهتر از بسیاری از مدلهای انگلیسیمحور ۳ میلیاردی حرف میزند، و قالب Instruct برای گفتگوی سازمانی آماده است. اگر حافظه بیشتر باشد میتوان Qwen2.5-7B-Instruct را با طول توالی کوتاهتر امتحان کرد؛ ولی مسیر اصلی همین ۳B است.
چرا ChatGPT نیست؟ چون ChatGPT یک سرویس بسته با حافظه و بهروزرسانی وزن در سمت فروشنده است. سینا باید هویت ساینا، اخلاق دفاعی، و دانش محصولات سازمان را نگه دارد. برای همین بهجای تکیه به یک مدل ابری ناشناس، دانش را در کوریکولوم و دانشنامه مینویسیم و لحن را با LoRA روی مدل منبعباز مینشانیم. پاسخ زنده تولید هم هنوز از مدل تنظیمشده محلی خوانده نمیشود مگر بعد از ارزیابی و انتشار صریح.
کوریکولوم سینا متن تألیفی است: TypeScript و API سازمانی، پایگاهداده، React امن، سیسکو و مایکروسافت، مشاهدهپذیری، RAG، و درسهای خود سازمان مثل سیما TV، آکادمی، CRM و انتقال تجربه متخصص. هر درس یک سند RAG میشود. ساخت دیتاست با tools/sina-train/build-dataset.ts این درسها را به ردیفهای instruction/input/output تبدیل میکند؛ هم نسخه میزکار ساختیافته و هم نسخه گفتار زنده.
آموزش وزن روی لپتاپ با tools/sina-train/train_qlora.py است. پیشنیاز: پایتون ۳.۱۱، PyTorch با CUDA، peft و transformers. روی ویندوز بهتر است ۴بیت bitsandbytes را اگر ناپایدار بود با --no-4bit و مدل ۳B جلو رفت. خروجی یک آداپتور LoRA است نه کل مدل. این آداپتور را باید روی چند ده سؤال طلایی IT و امنیت دفاعی سنجید: جواب باید منسجم باشد، نسخه فروشنده را حدس نزند، و درخواست نفوذ را رد کند.
بعد از قبول ارزیابی، مسیر انتشار این است: ادغام LoRA با مدل پایه، تبدیل به قالب Ollama یا vLLM، نام داخلی مثل sina-elite، و اتصال API فقط وقتی متریک کیفیت از پرسونای فعلی بهتر باشد. تا آن لحظه سینا روی سرور با RAG و پرسونا جواب میدهد. دانلود وزن از Hugging Face گاهی قطع میشود؛ جایگزین آزمایششده ModelScope و کپی محلی پوشه Qwen2.5-3B-Instruct است.
حافظه شبیه ChatGPT لایه چهارم نرم است: وزن مدل را عوض نمیکند. اگر بگویید «یادت بمونه» یا تجربه متخصص را ثبت کنید، سینا آن را در حافظه جلسه و مخزن تجربیات سازمان نگه میدارد و در نوبت بعد به پرامپت تزریق میکند. این همان انتقال تجربه است که برای شرکت لازم است. رمز، توکن و داده داخلی هرگز نباید وارد حافظه شود.
صدا جدا از زبان است. مدلهای Piper فارسی رسمی فعلاً همه مردانه هستند؛ برای همین گویندههای سینا خانم، نوجوان و فرشته روی موتور عصبی فارسی Dilara و گوینده سینا و رسمی روی Farid مینشینند. اگر موتور عصبی در دسترس نباشد همان Piper بهعنوان پشتیبان میماند. شخصیت بصری سیمرغ عوض نمیشود؛ فقط گوینده عوض میشود.
اخلاق آموزش ثابت است: امنیت فقط دفاعی و با مجوز، بدون اکسپلویت و بدافزار، بدون افشای زیرساخت یا نام مدل به کاربر نهایی. مسیر درست تغییر تولید همیشه lab، معیار پذیرش، پایلوت و rollback است. سینا جایگزین مهندس شیفت برای دستکاری خاموش سامانه زنده نیست.
جمعبندی عملی برای تیم: دانش جدید را در کوریکولوم یا مقاله بنویسید تا RAG همان روز یاد بگیرد. تجربه متخصص را با جمله «یادت بمونه» ثبت کنید تا حافظه جلسه و سازمان پر شود. Fine-tune را وقتی دیتاست و ارزیابی آماده است روی Qwen2.5-3B-Instruct اجرا کنید و فقط پس از قبول کیفیت به تولید ببرید. این سه مسیر با هم سینا را متخصص ساینا ارتباط میکند، نه پراکندهگو.