الهدف
هذا الدليل هو المسار الوحيد للتوجيه لكل من وضعي استخدام Decision Gate:
- يحرس DG تنفيذ المهارات الخارجية.
- يتم استدعاء DG كمهارة تقييم تكون دلالاتها/RET حتمية على المدخلات الملاحظة الكاملة.
كما يحدد كيف يمكن لحزام خارجي أن يتكون من كلا الوضعين دون السماح بتحريف السياسة التي كتبها LLM. هذا ليس تنفيذ سيناريو تكراري أو تنظيم عبر السيناريو المملوك لـ DG.
تُقسم منصة المهارات المملوكة للمستودع إلى حلقتين:
- الحلقة الداخلية:
decision-gate-authoring,decision-gate-verification - الحلقة الخارجية:
decision-gate-execution-boundary،decision-gate-incident-triage
أي مسار يجب استخدامه
| النية | المسار | قوة التنفيذ |
|---|---|---|
تغيير الحالة الخارجية (deploy, delete, pay, publish) | حراس DG لتنفيذ المهارة | حدود تغليف مغلقة؛ ليست صندوق خارج DG ذري |
| إنتاج التحليل/التقارير/دعم القرار | DG كمهارة تقييم | حساب فقط ما لم يتم تغليفه بواسطة حد |
| حلقات وكيل متعددة الخطوات تقوم بالتأليف ثم التنفيذ | تكوين الحزام (حارس خارجي + تقييم داخلي) | حزام خارجي مغلق؛ ليست أهلية تأثير ذرية |
المسار A: حراس DG لتنفيذ المهارة
استخدم هذا عندما تكون للإجراءات آثار جانبية.
الواجهة الرئيسية للمهارة:
decision-gate-execution-boundaryلقرارات السماح/الرفض الحيةdecision-gate-verificationلفحوصات ما بعد التشغيل المحدودة والتحقق من سلامة حزمة التشغيلdecision-gate-incident-triageعندما تمنع الحدود بشكل غير متوقع
عقد تشغيلي
- ملكية البوابة مملوكة للإنسان/السياسة.
- مواصفات البوابة هي مواد مُعتمدة على الإصدارات، وليست اختراعات LLM أثناء التشغيل.
- يجب أن تمر كل استدعاء مهارة متغيرة بتقييم DG المباشر قبل التنفيذ.
- تشغيل
activeيمنع التنفيذ؛ فقط حالة التشغيل المحددةcompletedتلبي نهائية السيناريو الأولية. - يجب أن تحتوي مواصفات البوابة العواقبية على تمرير مستقل للتكذيب قبل الاعتماد؛ المتغيرات المؤلفة ذاتيًا هي سياسة مرشحة، وليست دليلاً على الكفاية.
قائمة التحقق للإعداد
- تعريف خريطة بوابة لكل إجراء.
- قم بتأليف وتسجيل مواصفات السيناريو لكل فئة إجراء.
- تنفيذ غلاف وقت تشغيل رقيق:
evaluate -> allow/deny -> execute. - تصدير والتحقق من سلامة حزم التشغيل كأدلة تدقيق/تصدير مشتقة.
مثال على خريطة الإجراءات:
{
"deploy_to_prod": {
"scenario_id": "release-boundary-v1",
"scenario_law_identity": "<64-lowercase-hex>",
"required_min_lane": "verified",
"required_run_status": "completed"
},
"publish_external_report": {
"scenario_id": "publication-boundary-v1",
"scenario_law_identity": "<64-lowercase-hex>",
"required_min_lane": "verified",
"required_run_status": "completed"
}
}
مثال على منطق التغليف:
def guarded_skill_call(action_name, action_args):
policy = action_gate_map[action_name]
# scenario_start binds this new run to the exact immutable law identity.
run_id = start_run(policy["scenario_id"], policy["scenario_law_identity"])
operate_explicit_ready_stages(run_id) # external operator/harness policy
status = scenario_status(policy["scenario_id"], run_id)
if status["status"] != policy["required_run_status"]:
return {"allowed": False, "reason": "scenario_not_completed", "status": status}
runpack = runpack_export(policy["scenario_id"], run_id)
verify = runpack_verify(runpack["dir"], runpack["manifest_path"])
if verify["status"] != "passed":
return {"allowed": False, "reason": "runpack_verification_failed"}
skill_result = call_external_skill(action_name, action_args)
return {"allowed": True, "skill_result": skill_result, "accepted_head": status["accepted_head"]}
مراجع التنفيذ:
scenario_define,scenario_start,scenario_evaluate_stage: integration_patterns.md- مسار تدقيق runpack: integration_patterns.md
- تدفق المحول من النهاية إلى النهاية:
scripts/adapters/adapter_tests.sh --frameworks=openai_agents --validate
المسار ب: مهارة تقييم DG
استخدم هذا للتحليل المنظم عندما لا يتم تنفيذ أي إجراء مباشر ذو تأثير جانبي.
الواجهة الرئيسية للمهارة:
decision-gate-authoringdecision-gate-verification
عقد تشغيلي
- يستدعي DG مقارنة حتمية/دلالات RET على المدخلات الملاحظة الكاملة؛ تظل الاكتساب والتنظيم الحالي مفتوحة للعالم.
- المخرجات تدفع التفسير/التقارير، وليس التغيير المباشر.
- إذا تم طلب الطفرة لاحقًا، انتقل إلى حدود المسار A أولاً.
- تقرير التقييم الناجح يشير إلى أن المتغيرات المعلنة تم تقييمها على أنها صحيحة بناءً على الأدلة المقدمة/المكتسبة الحالية ودلالات السياسة الحالية. لا يثبت بمفرده صحة الأدلة، أو كفاية المتغيرات، أو الالتزام المقبول، أو النية غير المعلنة وراءها.
تدفق الأدوات النموذجي
- قراءة الموارد والأدوات/المخططات المولدة وملف القدرات المحلية الدقيقة.
- بناء العناصر:
claim_inventory,capability_matrix,claim_condition_map. - تقييم:
scenario_precheck_stageمقابل قانون مسجل دقيق للتكرار، ثمscenario_start->scenario_open_stage->scenario_evaluate_stageمع أدلة المتصل العدائي أو توجيهات الاكتساب المحلي المحدودة الصريحة. - تصدير والتحقق من سلامة حزمة التشغيل عند الحاجة إلى عنصر تدقيق/تصدير
مشتق:
runpack_export،runpack_verify.
عقد الهدف الدائم: llm_native_playbook.md. تظل تسلسل الأدوات في هذا الدليل تمرينًا على إدخال العقد الحالي حتى يقوم PF-09 بإعادة توليد الإسقاطات القابلة للتنفيذ.
المسار C: تكوين الحبال (حلقة التأليف + حدود التنفيذ)
هذه هي القلق الشائع “DG داخل سير عمل الوكيل الذي يستخدم أيضًا DG كحارسه الخارجي”. يقوم الحزام بتسلسل استدعاءات DG المستقلة؛ لا يقوم المقيم أبدًا باستدعاء سيناريو آخر.
استخدم نموذج الحلقة:
- الحلقة الداخلية: التأليف والتحقق.
- الحلقة الخارجية: حدود التنفيذ وتقييم الحوادث للتحكم العواقبي.
قواعد صارمة:
- قد يقترح الحلقة الداخلية خرائط؛ ولا يمكنها تخفيف سياسة الحلقة الخارجية.
- تظل تعريفات بوابة الحلقة الخارجية مؤلفة من النظام ومُعَدَّلة.
- كتل الحلقة الخارجية على أي مطالبة مطلوبة غير محلولة بغض النظر عن نص ثقة الحلقة الداخلية.
- الهوية القانونية للسيناريو غير القابلة للتغيير ورأس التشغيل المقبول هما مصادر القرار الدلالي لـ DG. يثبت التحقق الأساسي من حزمة التشغيل فحوصات سلامة العنصر المسماة؛ التحقق المدعوم من السلطة يعيد التحقق من القانون العدائي ويعيد تشغيل التاريخ الدلالي المقبول عند استخدام ذلك المسار الصريح. لا يثبت أي من الوضعين تسليم التأثير الخارجي، أو السببية عبر السيناريو، أو الاسترداد، أو تأهيل النشر، أو عدم الإنكار المؤهل بالسياسة.
- تتطلب تغييرات بوابة الحلقة الخارجية العواقبية تكذيبًا مستقلًا للمتغيرات أثناء التأليف، قبل الاستخدام المباشر.
نموذج مضاد يجب تجنبه:
"The agent self-evaluated with DG and therefore can deploy."
"The agent authored new predicates, passed them, and therefore the intended claim is proven."
نمط صحيح:
"The agent used DG for analysis, then the system-enforced deployment gate passed live, then deploy executed."
"The authoring agent proposed predicates, a separate review attempted to falsify them, unresolved false-green risks were blocked, and only then was the gate used for closure."
مسار الانضمام السريع (المستودع)
استخدم هذه السلسلة عند إدخال البشر أو وكلاء LLM إلى كلا المسارين.
- قم بتشغيل الاختبار السريع الذي يتكون من أمر واحد (كلا المسارين + حالة الرفض القسري):
scripts/bootstrap/skill_pathways_quickstart.sh configs/presets/quickstart-dev.toml
- اقرأ llm_native_playbook.md وهذا الدليل.
- تثبيت المهارات:
scripts/skills/install_local.sh
- قم بتشغيل حلقة التوجيه من البداية إلى النهاية:
bash scripts/adapters/adapter_tests.sh --frameworks=openai_agents --validate
- تشغيل مصفوفة الصحة الحتمية:
uv run --project . --locked --extra quality python scripts/skills/eval_runner.py \
--mode deterministic \
--cases all \
--out-dir .tmp/skills/eval-deterministic-local
- تشغيل مصفوفة مطلوبة حية للمهارات المواجهة للحدود:
uv run --project . --locked --extra quality python scripts/skills/eval_runner.py \
--mode live \
--cases live-required \
--out-dir .tmp/skills/eval-live-local
تعريف الانتهاء (الحد الأدنى بدون أخطاء)
قبل إعلان اكتمال التبني:
- يتم تغليف المهارات المتغيرة بواسطة منطق حدود المسار A.
- مواصفات البوابة مُعتمدة على إصدار وملكية سياسة (وليس نصًا عشوائيًا).
- يتم تثبيت المهارات الأربع المدعومة كحزم مستقلة بدون مراجع خارجية من المستودع.
- تتضمن التعليمات الموجهة لـ LLM قواعد توقف صارمة واضحة.
- تقارير تقييم المهارات الحتمية تمر للحالات المطلوبة.
- تقارير تقييم المهارة المطلوبة الحية تمر للحالات المواجهة للحدود.
- اجتياز التحقق من حزمة التشغيل في سير العمل الحي.