Hermes Agent: إعداد النماذج

آخر تحديث: 2026-08-31

إعداد النماذج مثل اختيار محرك — مهام مختلفة تحتاج محركات مختلفة. الأسئلة البسيطة تستخدم الاقتصادي، الاستدلال المعقد يستخدم القوي. Hermes يبدل بمرونة.

💡 نصيحة: Hermes يدعم استراتيجيات توجيه النماذج التي تختار تلقائيًا أفضل نموذج بناءً على تعقيد المهمة، موازنة بين الجودة والتكلفة.

📋 المتطلبات المسبقة: الدرس 3 — ملفات الإعداد

1. ما ستتعلمه

# المحتوى
مزودو النماذج المدعومون
شرح إعداد models.yaml
تكامل النماذج المحلية (Ollama/vLLM)
استراتيجيات توجيه النماذج
تقنيات تحسين التكاليف

2. القصة

(1) المشكلة: GPT-4 مكلف جدًا، النماذج الصغيرة ضعيفة جدًا

Bob يستخدم GPT-4 لكل شيء، ينفق 200+ دولار شهريًا على تكاليف API. لكن 80% من المهام تعمل بشكل جيد مع GPT-4o-mini. Alice تستخدم توجيه النماذج — المهام البسيطة تستخدم نماذج صغيرة تلقائيًا، الاستدلال المعقد يستخدم نماذج كبيرة — والتكلفة تنخفض إلى 40 دولار.

(2) الحل: توجيه ذكي للنماذج

YAML
routing:
  simple_tasks: "gpt-4o-mini"
  medium_tasks: "gpt-4o"
  complex_tasks: "gpt-4o"
  code_execution: "claude-3.5-sonnet"
  fallback: "llama3.2"

3. مزودو النماذج المدعومون

المزود أمثلة النماذج الإعداد
OpenAI gpt-4o, gpt-4o-mini, o1 OPENAI_API_KEY
Anthropic claude-3.5-sonnet, claude-3-haiku ANTHROPIC_API_KEY
Google gemini-2.0-flash, gemini-pro GOOGLE_API_KEY
Mistral mistral-large, mistral-small MISTRAL_API_KEY
Ollama (محلي) llama3.2, qwen2.5, deepseek خدمة محلية
vLLM (محلي) أي نموذج HuggingFace خدمة محلية
OpenRouter 200+ نموذج عبر API موحد OPENROUTER_API_KEY

4. إعداد models.yaml

YAML
# ~/.hermes/models.yaml

providers:
  openai:
    api_key: "${OPENAI_API_KEY}"
    base_url: "https://api.openai.com/v1"
    rate_limit: 100
  anthropic:
    api_key: "${ANTHROPIC_API_KEY}"
  ollama:
    base_url: "http://localhost:11434"
    timeout: 120

models:
  gpt-4o:
    provider: openai
    context_window: 128000
    input_cost: 2.50
    output_cost: 10.00
    capabilities:
      - chat
      - vision
      - function_calling
  gpt-4o-mini:
    provider: openai
    context_window: 128000
    input_cost: 0.15
    output_cost: 0.60
    capabilities:
      - chat
      - function_calling
  llama3.2:
    provider: ollama
    context_window: 128000
    input_cost: 0
    output_cost: 0
    capabilities:
      - chat

routing:
  strategy: "capability-based"
  rules:
    - condition: "complexity < 0.3"
      model: "gpt-4o-mini"
    - condition: "complexity >= 0.3 and complexity < 0.7"
      model: "gpt-4o"
    - condition: "task_type == 'code'"
      model: "claude-3.5-sonnet"
    - condition: "offline == true"
      model: "llama3.2"

5. تكامل النماذج المحلية

(1) Ollama

YAML
providers:
  ollama:
    base_url: "http://localhost:11434"

models:
  llama3.2:
    provider: ollama
    context_window: 128000
BASH
ollama pull llama3.2
hermes model list --provider ollama

(2) vLLM

YAML
providers:
  vllm:
    base_url: "http://localhost:8000"
    api_format: "openai"

6. استراتيجيات توجيه النماذج

(1) توجيه حسب القدرة (موصى به)

PYTHON
def select_model(task):
    if task.requires_vision:
        return "gpt-4o"
    if task.complexity < 0.3:
        return "gpt-4o-mini"
    if task.type == "code":
        return "claude-3.5-sonnet"
    return config.default_model

(2) توجيه حسب التكلفة

YAML
routing:
  strategy: "cost-based"
  quality_threshold: 0.8
  max_cost_per_request: 0.05

(3) تحديد يدوي

BASH
hermes chat --model gpt-4o
hermes chat --model claude-3.5-sonnet --mode code
hermes chat --model llama3.2 --offline

7. تحسين التكاليف

(1) مراقبة التكاليف

BASH
hermes cost report --month
# ┌──────────────┬──────────┬───────────┬─────────┐
# │ Model        │ Requests │ Tokens In │ Cost    │
# ├──────────────┼──────────┼───────────┼─────────┤
# │ gpt-4o-mini  │ 1,200    │ 2.4M      │ $2.16   │
# │ gpt-4o       │ 80       │ 0.8M      │ $12.00  │
# │ Total        │ 1,280    │ 3.2M      │ $14.16  │
# └──────────────┴──────────┴───────────┴─────────┘

(2) استراتيجيات التحسين

الاستراتيجية التوفير التنفيذ
توجيه النماذج 60-80% نماذج صغيرة للمهام البسيطة
تخزين مؤقت للردود 10-20% لا استدعاءات متكررة لنفس الأسئلة
هجين مع نموذج محلي 50-90% Ollama للمهام غير المتصلة
ضغط التوكنات 15-30% تقليل System Prompts

❓ أسئلة شائعة

س كم عدد النماذج المدعومة؟
ج أكثر من 200 نموذج عبر OpenRouter لجميع النماذج السائدة، плюс نماذج محلية غير محدودة عبر Ollama.
س هل يمكنني استخدام مفاتيح API متعددة في وقت واحد؟
ج نعم. أعد مزودين متعددين في models.yaml، كل واحد بمفتاحه الخاص. التوجيه يقرر أيهما يُستخدم.
س هل توجيه النماذج دقيق؟
ج التوجيه حسب القدرة مع علامات نوع المهمة ودرجة التعقيد يحقق دقة ~90%. عدّل القواعد يدويًا للتحسين.
س هل النماذج المحلية جيدة بما يكفي؟
ج نماذج 8B تكفي للأسئلة البسيطة؛ نماذج 70B+ تقترب من مستوى GPT-3.5. مهام الكود والاستدلال لا تزال توصي بالنماذج السحابية الكبيرة.

📖 ملخص


📝 تمارين

  1. أساسي (⭐): أعد مزودي نماذج (مثلاً: OpenAI + Ollama)، تحقق أن كلاهما يعمل.
  2. متوسط (⭐⭐): أعد توجيه النماذج: المهام البسيطة تستخدم gpt-4o-mini، المعقدة تستخدم gpt-4o.
  3. متقدم (⭐⭐⭐): صمّم خطة هجينة بتكلفة مثالية بميزانية 20 دولار شهريًا، احسب عدد الطلبات المدعومة.
Web-Tutorial.com

فريق Web-Tutorial التقني

منصة دروس برمجية يديرها عدة مطورين. كل درس يتم كتابته ومراجعته بواسطة مطورين متخصصين في المجال. نعمل على ضمان دقة وموثوقية المحتوى — إذا لاحظت أي مشكلة، فيرجى إخبارنا.

100%