Hermes Agent: إعداد النماذج
آخر تحديث: 2026-08-31
إعداد النماذج مثل اختيار محرك — مهام مختلفة تحتاج محركات مختلفة. الأسئلة البسيطة تستخدم الاقتصادي، الاستدلال المعقد يستخدم القوي. Hermes يبدل بمرونة.
💡 نصيحة: Hermes يدعم استراتيجيات توجيه النماذج التي تختار تلقائيًا أفضل نموذج بناءً على تعقيد المهمة، موازنة بين الجودة والتكلفة.
📋 المتطلبات المسبقة: الدرس 3 — ملفات الإعداد
1. ما ستتعلمه
| # | المحتوى |
|---|---|
| ❶ | مزودو النماذج المدعومون |
| ❷ | شرح إعداد models.yaml |
| ❸ | تكامل النماذج المحلية (Ollama/vLLM) |
| ❹ | استراتيجيات توجيه النماذج |
| ❺ | تقنيات تحسين التكاليف |
2. القصة
(1) المشكلة: GPT-4 مكلف جدًا، النماذج الصغيرة ضعيفة جدًا
Bob يستخدم GPT-4 لكل شيء، ينفق 200+ دولار شهريًا على تكاليف API. لكن 80% من المهام تعمل بشكل جيد مع GPT-4o-mini. Alice تستخدم توجيه النماذج — المهام البسيطة تستخدم نماذج صغيرة تلقائيًا، الاستدلال المعقد يستخدم نماذج كبيرة — والتكلفة تنخفض إلى 40 دولار.
(2) الحل: توجيه ذكي للنماذج
YAML
routing:
simple_tasks: "gpt-4o-mini"
medium_tasks: "gpt-4o"
complex_tasks: "gpt-4o"
code_execution: "claude-3.5-sonnet"
fallback: "llama3.2"
3. مزودو النماذج المدعومون
| المزود | أمثلة النماذج | الإعداد |
|---|---|---|
| OpenAI | gpt-4o, gpt-4o-mini, o1 | OPENAI_API_KEY |
| Anthropic | claude-3.5-sonnet, claude-3-haiku | ANTHROPIC_API_KEY |
| gemini-2.0-flash, gemini-pro | GOOGLE_API_KEY |
|
| Mistral | mistral-large, mistral-small | MISTRAL_API_KEY |
| Ollama (محلي) | llama3.2, qwen2.5, deepseek | خدمة محلية |
| vLLM (محلي) | أي نموذج HuggingFace | خدمة محلية |
| OpenRouter | 200+ نموذج عبر API موحد | OPENROUTER_API_KEY |
4. إعداد models.yaml
YAML
# ~/.hermes/models.yaml
providers:
openai:
api_key: "${OPENAI_API_KEY}"
base_url: "https://api.openai.com/v1"
rate_limit: 100
anthropic:
api_key: "${ANTHROPIC_API_KEY}"
ollama:
base_url: "http://localhost:11434"
timeout: 120
models:
gpt-4o:
provider: openai
context_window: 128000
input_cost: 2.50
output_cost: 10.00
capabilities:
- chat
- vision
- function_calling
gpt-4o-mini:
provider: openai
context_window: 128000
input_cost: 0.15
output_cost: 0.60
capabilities:
- chat
- function_calling
llama3.2:
provider: ollama
context_window: 128000
input_cost: 0
output_cost: 0
capabilities:
- chat
routing:
strategy: "capability-based"
rules:
- condition: "complexity < 0.3"
model: "gpt-4o-mini"
- condition: "complexity >= 0.3 and complexity < 0.7"
model: "gpt-4o"
- condition: "task_type == 'code'"
model: "claude-3.5-sonnet"
- condition: "offline == true"
model: "llama3.2"
5. تكامل النماذج المحلية
(1) Ollama
YAML
providers:
ollama:
base_url: "http://localhost:11434"
models:
llama3.2:
provider: ollama
context_window: 128000
BASH
ollama pull llama3.2
hermes model list --provider ollama
(2) vLLM
YAML
providers:
vllm:
base_url: "http://localhost:8000"
api_format: "openai"
6. استراتيجيات توجيه النماذج
(1) توجيه حسب القدرة (موصى به)
PYTHON
def select_model(task):
if task.requires_vision:
return "gpt-4o"
if task.complexity < 0.3:
return "gpt-4o-mini"
if task.type == "code":
return "claude-3.5-sonnet"
return config.default_model
(2) توجيه حسب التكلفة
YAML
routing:
strategy: "cost-based"
quality_threshold: 0.8
max_cost_per_request: 0.05
(3) تحديد يدوي
BASH
hermes chat --model gpt-4o
hermes chat --model claude-3.5-sonnet --mode code
hermes chat --model llama3.2 --offline
7. تحسين التكاليف
(1) مراقبة التكاليف
BASH
hermes cost report --month
# ┌──────────────┬──────────┬───────────┬─────────┐
# │ Model │ Requests │ Tokens In │ Cost │
# ├──────────────┼──────────┼───────────┼─────────┤
# │ gpt-4o-mini │ 1,200 │ 2.4M │ $2.16 │
# │ gpt-4o │ 80 │ 0.8M │ $12.00 │
# │ Total │ 1,280 │ 3.2M │ $14.16 │
# └──────────────┴──────────┴───────────┴─────────┘
(2) استراتيجيات التحسين
| الاستراتيجية | التوفير | التنفيذ |
|---|---|---|
| توجيه النماذج | 60-80% | نماذج صغيرة للمهام البسيطة |
| تخزين مؤقت للردود | 10-20% | لا استدعاءات متكررة لنفس الأسئلة |
| هجين مع نموذج محلي | 50-90% | Ollama للمهام غير المتصلة |
| ضغط التوكنات | 15-30% | تقليل System Prompts |
❓ أسئلة شائعة
س كم عدد النماذج المدعومة؟
ج أكثر من 200 نموذج عبر OpenRouter لجميع النماذج السائدة، плюс نماذج محلية غير محدودة عبر Ollama.
س هل يمكنني استخدام مفاتيح API متعددة في وقت واحد؟
ج نعم. أعد مزودين متعددين في models.yaml، كل واحد بمفتاحه الخاص. التوجيه يقرر أيهما يُستخدم.
س هل توجيه النماذج دقيق؟
ج التوجيه حسب القدرة مع علامات نوع المهمة ودرجة التعقيد يحقق دقة ~90%. عدّل القواعد يدويًا للتحسين.
س هل النماذج المحلية جيدة بما يكفي؟
ج نماذج 8B تكفي للأسئلة البسيطة؛ نماذج 70B+ تقترب من مستوى GPT-3.5. مهام الكود والاستدلال لا تزال توصي بالنماذج السحابية الكبيرة.
📖 ملخص
- أكثر من 200 نموذج من 6 مزودين + نماذج محلية
- models.yaml يحدد سمات النماذج وتكاليفها وقدراتها
- توجيه النماذج: حسب القدرة (موصى به)، حسب التكلفة، يدوي
- نماذج محلية عبر Ollama/vLLM لاستنتاج بتكلفة صفر
- تحسين التكاليف: توجيه + تخزين مؤقت + هجين محلي يوفر 60-80%
📝 تمارين
- أساسي (⭐): أعد مزودي نماذج (مثلاً: OpenAI + Ollama)، تحقق أن كلاهما يعمل.
- متوسط (⭐⭐): أعد توجيه النماذج: المهام البسيطة تستخدم gpt-4o-mini، المعقدة تستخدم gpt-4o.
- متقدم (⭐⭐⭐): صمّم خطة هجينة بتكلفة مثالية بميزانية 20 دولار شهريًا، احسب عدد الطلبات المدعومة.