Compare commits
3 Commits
dc76ca67b8
...
main
| Author | SHA1 | Date | |
|---|---|---|---|
| e1ca9f4127 | |||
| 3f9677f6aa | |||
| 47e4846270 |
@@ -14,9 +14,9 @@ OLLAMA_BASE_URL=http://192.168.10.10:11435
|
||||
|
||||
# Retrieval defaults
|
||||
TOP_K=5
|
||||
# Neighbor Expansion for fixed_size only (ADR-0023); 0 = off
|
||||
NEIGHBOR_PREV=0
|
||||
NEIGHBOR_NEXT=0
|
||||
# Neighbor Expansion for fixed_size only (ADR-0023); 3/3 = stabilized default after benchmark
|
||||
NEIGHBOR_PREV=3
|
||||
NEIGHBOR_NEXT=3
|
||||
|
||||
# LLM generation parameters
|
||||
TEMPERATURE=0.0
|
||||
|
||||
@@ -87,7 +87,7 @@ The configured catalog of Embedding Models the operator may assign to Boundary o
|
||||
_Avoid_: Model list, provider catalog, available embeddings
|
||||
|
||||
**Neighbor Expansion**:
|
||||
Query-time widening of retrieved context for the `fixed_size` Strategy only: for every top-k hit, also include a configurable number of previous and next chunks in document order within the same document. Neighbors are added on top of the top-k set (context may grow beyond k). The same chunk id appears at most once in the LLM context. Final LLM context is sorted by document order (`chunk_index`). Neighbors are not re-ranked as independent hits. Counts (`neighbor_prev` / `neighbor_next`) are set per Query or Experiment like `top_k`; defaults are `0`/`0` (off). Missing neighbors at document edges are skipped. Knobs are ignored for non-`fixed_size` Strategies. Dashboard labels Experiments with a compact `±P/N` badge (tooltip explains prev/next; muted when `fixed_size` was not in the run). Experiments list and Compare show these knobs; Compare warns when selected Experiments differ on Neighbor Expansion, Corpus Embedding Model, or Boundary Embedding Model (when recorded) so operators do not misread cross-run rankings. Distinct from how a Strategy cuts text at process time.
|
||||
Query-time widening of retrieved context for the `fixed_size` Strategy only: for every top-k hit, also include a configurable number of previous and next chunks in document order within the same document. Neighbors are added on top of the top-k set (context may grow beyond k). The same chunk id appears at most once in the LLM context. Final LLM context is sorted by document order (`chunk_index`). Neighbors are not re-ranked as independent hits. Counts (`neighbor_prev` / `neighbor_next`) are set per Query or Experiment like `top_k`; benchmarker defaults are `3`/`3` (symmetric ±3 after Strategy finalization); `0`/`0` turns expansion off. Missing neighbors at document edges are skipped. Knobs are ignored for non-`fixed_size` Strategies. Dashboard labels Experiments with a compact `±P/N` badge (tooltip explains prev/next; muted when `fixed_size` was not in the run). Experiments list and Compare show these knobs; Compare warns when selected Experiments differ on Neighbor Expansion, Corpus Embedding Model, or Boundary Embedding Model (when recorded) so operators do not misread cross-run rankings. Distinct from how a Strategy cuts text at process time.
|
||||
_Avoid_: Context windowing, chunk padding, sliding window retrieval, adjacent chunk merge
|
||||
|
||||
**Expansion Tree**:
|
||||
|
||||
@@ -29,6 +29,7 @@ Complete documentation for the RAG Chunking Benchmarker.
|
||||
| [data-flow.md](data-flow.md) | How data moves through the system | Engineers |
|
||||
| [chunking_strategies.md](chunking_strategies.md) | High-level strategy overview | Everyone |
|
||||
| [final-chunking-strategy-decision.md](final-chunking-strategy-decision.md) | Final Strategy family decision (`fixed_size`) + charts | Managers, operators |
|
||||
| [human-eval-fixed-size-plus3-report.md](human-eval-fixed-size-plus3-report.md) | Human evaluation of fixed_size ±3 (sample + charts) | Managers, operators |
|
||||
| [adr/](adr/) | Architectural Decision Records | Everyone |
|
||||
| [phases.md](phases.md) | Implementation phases | Project managers |
|
||||
| [tasks.md](tasks.md) | Task tracking | Developers |
|
||||
|
||||
@@ -82,6 +82,9 @@ Delete a document and its vectors.
|
||||
|
||||
Run chunking strategies on a document.
|
||||
|
||||
**Query parameters:**
|
||||
- `background` (bool, default `false`) — when `true`, enqueue processing and return **202** with a `job_id`; poll `GET /jobs/{job_id}`.
|
||||
|
||||
**Request:**
|
||||
```json
|
||||
{
|
||||
@@ -199,6 +202,9 @@ Retrieve a past query.
|
||||
|
||||
Run a benchmark comparing multiple strategies.
|
||||
|
||||
**Query parameters:**
|
||||
- `background` (bool, default `false`) — when `true`, enqueue the run and return **202** with a `job_id`; poll `GET /jobs/{job_id}` for status and result.
|
||||
|
||||
**Request:**
|
||||
```json
|
||||
{
|
||||
@@ -278,6 +284,32 @@ List all experiments.
|
||||
|
||||
---
|
||||
|
||||
### Jobs
|
||||
|
||||
Background execution for long-running benchmarks and document processing (FastAPI `BackgroundTasks` + SQLite job records).
|
||||
|
||||
#### `GET /jobs`
|
||||
|
||||
List jobs (newest first).
|
||||
|
||||
**Query parameters:** `job_type`, `status`, `offset`, `limit`
|
||||
|
||||
#### `GET /jobs/{job_id}`
|
||||
|
||||
Poll job status. When `status` is `completed`, `result` contains the same payload as the synchronous endpoint would return; when `failed`, `error` is set.
|
||||
|
||||
**Response (202 enqueue body from POST with `background=true`):**
|
||||
```json
|
||||
{
|
||||
"job_id": "abc123",
|
||||
"job_type": "benchmark",
|
||||
"status": "pending",
|
||||
"poll_url": "/jobs/abc123"
|
||||
}
|
||||
```
|
||||
|
||||
---
|
||||
|
||||
## Error Responses
|
||||
|
||||
All errors return:
|
||||
|
||||
61
docs/assets/human-eval/fixed_size_plus3_human_scores.csv
Normal file
61
docs/assets/human-eval/fixed_size_plus3_human_scores.csv
Normal file
@@ -0,0 +1,61 @@
|
||||
document,question_id,question,expected_answer,generated_answer,llm_context_relevance,llm_answer_similarity,llm_faithfulness,llm_hallucination,llm_composite,human_score,human_notes,agreement,experiment_id
|
||||
bazresi.docx,q1,این سند در مورد چیست؟,این سند شامل پرسشهای پرتکرار از سوی مشتریان در اداره پاسخگویی و رسیدگی به شکایات شرکت بیمه آسیا است که پاسخهایی درباره مهلت پرداخت خسارت، ثبت شکایت، شماره شبا و سایر موارد اداری ارائه میدهد.,این سند در مورد پرسشهای متداول مشتریان در اداره پاسخگویی و رسیدگی به شکایات بیمه آسیا و اطلاعات مربوط به پرداخت خسارت، نحوه دریافت بیمهنامه، ثبت شکایت و سایر خدمات بیمهای است.,9,8,9,False,8.6,3,Partially correct; missing secondary details.,partial,6fe08750ee324130b3d46d8b3bc95280
|
||||
bazresi.docx,q3,مدت زمان پرداخت خسارت بدنه چقدر است؟,طبق ماده 20 آیین نامه 53 بیمه بدنه، مدت زمان پرداخت خسارت بدنه 15 روز کاری پس از تکمیل پرونده میباشد. در صورت تأیید اصالت حادثه و بالا بودن مبلغ خسارت، امکان واریز علی الحساب تا 60 درصد مبلغ خسارت وجود دارد که منوط به ثبت درخواست کتبی از سوی زیاندیده در شعبه پرداخت خسارت است.,مدت زمان پرداخت خسارت بدنه 15 روز کاری پس از تکمیل پرونده می باشد.,10,8,9,False,8.9,4,Aligns with expected answer; key points covered.,agree,6fe08750ee324130b3d46d8b3bc95280
|
||||
bazresi.docx,q6,نحوه ثبت الحاقیه یا فسخ بیمهنامه بدنه مربوط به خودروهای شرکتهای لیزینگی چگونه است؟,بیمهگذار (مستأجر خودرو) باید به واحد صدور یا شعبه ناظر واحد صادرکننده مراجعه نموده و با ارائه اصل بیمهنامه بدنه، مدارک فک رهنی، سند مالکیت و درخواست کتبی نسبت به صدور الحاقیه یا فسخ اقدام نماید.,بیمهگذار (مستأجر خودرو) باید به واحد صدور ذکر شده در بیمهنامه یا شعبه ناظر واحد صادر کننده مراجعه نموده و با ارائه اصل بیمهنامه بدنه، مدارک فک رهنی، سند مالکیت و درخواست کتبی خود مبنی بر صدور الحاقیه یا فسخ بیمهنامه نسبت به این مهم اقدام نماید. در صورتی که بیمهگذار، ساکن استانی غیر از استان محل استقرار واحد صدور بیمهنامه باشد، باید با در دست داشتن مدارک فوقالذکر به شعبه مرکزی آن استان مراجعه و درخواست کتبی خود را ارائه نماید.,10,9,10,False,9.6,5,Aligns with expected answer; key points covered.,agree,6fe08750ee324130b3d46d8b3bc95280
|
||||
bazresi.docx,q9,آیا نتیجه اعتراض به مبلغ خسارت کارشناس الزاماً منجر به افزایش مبلغ میشود؟,خیر. زیاندیده میتواند با مراجعه به رئیس شعبه خسارت، درخواست کتبی جهت اعتراض ثبت نماید. اما نتیجه اعتراض الزاماً منجر به افزایش مبلغ خسارت نمیشود و ممکن است پس از کارشناسی مجدد، مبلغ تأیید شود یا حتی کاهش یابد.,خیر، نتیجه اعتراض الزاماً منجر به افزایش میزان مبلغ خسارت نمیشود و ممکن است پس از بررسی و کارشناسی مجدد، مبلغ مربوطه تأیید شود یا کاهش یابد.,9,9,10,False,9.3,5,Aligns with expected answer; key points covered.,agree,6fe08750ee324130b3d46d8b3bc95280
|
||||
bazresi.docx,q11,آیا امکان دریافت فیزیک بیمهنامه ثالث از طریق لینک پیامکی وجود نداشته باشد، چه باید کرد؟,در صورت عدم دسترسی به لینک، با مراجعه به سایت بیمه آسیا (www.bimehasia.com) و بخش خدمات الکترونیک -> استعلامها -> استعلام و چاپ بیمهنامه ثالث با وارد کردن کد بیمهگذار و شماره بیمهنامه میتوان فایل را دریافت کرد.,در صورتی که از طریق لینک پیامکی قادر به ورود به صفحه مربوطه نبودید، میتوانید با مراجعه به سایت بیمه آسیا به نشانی www.bimehasia.com و ورود به قسمت خدمات الکترونیک، استعلامها، استعلام و چاپ بیمه نامه ثالث و با وارد کردن کد بیمهگذار و شماره بیمهنامه مربوطه، نسبت به مشاهده، چاپ یا دریافت فایل بیمهنامه ثالث اقدام نمایید.,9,9,10,False,9.3,4,Aligns with expected answer; key points covered.,partial,6fe08750ee324130b3d46d8b3bc95280
|
||||
bazresi.docx,q14,شماره تماس واحد پاسخگویی و رسیدگی به شکایات چیست؟,در سند اطلاعات تماس مستقیم واحد پاسخگویی ذکر نشده اما از طریق سامانههای رسیدگی به شکایات بیمه مرکزی یا بازرسی کل کشور یا از طریق سایت بیمه آسیا قابل دسترسی است.,متأسفانه، اطلاعاتی درباره شماره تماس واحد پاسخگویی و رسیدگی به شکایات در متن موجود نیست.,7,8,9,False,8.0,5,Aligns with expected answer; key points covered.,partial,6fe08750ee324130b3d46d8b3bc95280
|
||||
customer1.docx,q1,این سند در مورد چیست؟,این سند شامل پرسشهای متداول درباره استعلام و مناقصه بیمهای، توسعه بازار و کد یونیک، و شرایط انعقاد تفاهمنامه شرکت بیمه آسیا است.,این سند در مورد مناقصات بیمهای و استعلامات مرتبط با آن است. اطلاعاتی درباره تعریف مناقصه، انواع مناقصات، قوانین برگزاری، و شرایط مختلف مرتبط با مناقصات بیمهای ارائه میدهد.,8,7,8,False,7.6,4,Aligns with expected answer; key points covered.,agree,8c4d888d367b4c0299b2d19dd9654f80
|
||||
customer1.docx,q4,مناقصه بیمهای و استعلام بیمهای چه تفاوتی با یکدیگر دارند؟,تفاوت کاربرد استعلام بها و مناقصه به میزان مبلغ معامله بستگی خواهد داشت. بر اساس ماده 3 قانون برگزاری مناقصات، معاملات کوچک و متوسط (بالاتر از ده درصد نصاب مربوط) متفاوت از معاملات بزرگ اجرا میشوند.,تفاوت مناقصه بیمهای و استعلام بیمهای به میزان مبلغ معامله بستگی دارد. برای معاملات کوچک و متوسط (تا 2.850 میلیون ریال) از استعلام بها استفاده میشود، در حالی که برای معاملات بزرگ (بیش از 28.500 میلیون ریال) باید از طریق مناقصه عمومی یا محدود اقدام شود.,9,8,9,False,8.6,4,Aligns with expected answer; key points covered.,agree,8c4d888d367b4c0299b2d19dd9654f80
|
||||
customer1.docx,q7,آیا ثبت معاملات در سامانه ستاد الزامی است؟,بله. ثبت کلیه معاملات دولت اعم از کوچک و متوسط و بزرگ در سامانه ستاد الزامی است. طبق مکاتبه معاونت حقوقی رئیس جمهور، ثبت معاملات کوچک (بالاتر از ده درصد نصاب مربوط) در سامانه تدارکات الکترونیکی الزامی است.,بله، ثبت کلیه معاملات دولت اعم از کوچک و متوسط و بزرگ در سامانه ستاد الزامی است.,8,9,9,False,8.7,4,Aligns with expected answer; key points covered.,partial,8c4d888d367b4c0299b2d19dd9654f80
|
||||
customer1.docx,q11,آیا میتوان بخشی از ریسک را بین چند بیمهگر تقسیم کرد؟,بله، از طریق بیمه اتکایی، این روش در پروژههای بزرگ متداول است.,بله، از طریق بیمه اتکایی، این روش در پروژههای بزرگ متداول است.,10,10,10,False,10.0,4,Aligns with expected answer; key points covered.,partial,8c4d888d367b4c0299b2d19dd9654f80
|
||||
customer1.docx,q14,شرایط اخذ کد یونیک چیست؟,بیمهگذاران باید سراسری باشند (پراکندگی و فعالیت در کل کشور) و دارای چند رشته بیمهای باشند.,بیمه گذاران باید سراسری باشند (پراکندگی و فعالیت در کل کشور) و دارای چند رشته بیمه ای باشند.,10,10,10,False,10.0,4,Aligns with expected answer; key points covered.,partial,8c4d888d367b4c0299b2d19dd9654f80
|
||||
customer1.docx,q17,برای اخذ تخفیفات و تسهیلات چه اقداماتی نیاز است؟,نامه درخواست شرکت متقاضی و نامه درخواست نماینده/شعبه.,برای اخذ تخفیفات و تسهیلات، نیاز به نامه درخواست شرکت متقاضی و نامه درخواست نماینده/شعبه است.,10,10,10,False,10.0,4,Aligns with expected answer; key points covered.,partial,8c4d888d367b4c0299b2d19dd9654f80
|
||||
fire.docx,q1,این سند در مورد چیست؟,این سند شامل شرایط خصوصی هر یک از پوششهای اضافی (خطرات اضافی) بیمه آتشسوزی شامل سیل، زلزله، ترکیدگی لوله آب، نشت باران، سقوط هواپیما، اعتصاب و شورش، برخورد جسم خارجی، شکست شیشه، انفجار ظروف تحت فشار، سرقت با شکست حرز و سایر خطرات است.,این سند در مورد شرایط و مقررات بیمهنامههای مختلف، شامل بیمههای آتشسوزی، سرقت، خسارات ناشی از اعتصاب و شورش، و سایر خطرات مرتبط با بیمه است. همچنین به تعهدات بیمهگر و بیمهگذار، استثنائات، فرانشیزها و حداکثر تعهدات مالی اشاره دارد.,8,7,8,False,7.6,4,Aligns with expected answer; key points covered.,agree,230a3cf57ae74b679ecde83cfeb9b6f5
|
||||
fire.docx,q4,پوشش ترکیدگی لوله آب شامل چه مواردی است و چه استثنائاتی دارد؟,شامل: خسارات ناشی از ترکیدگی یا درز برداشتن لولههای آب یا فاضلاب متصل به شبکه آبرسانی یا سرریز شدن منابع و مخازن آب. استثنائات: هزینه ترمیم/استهلاک، خسارت منشاء حادثه، خسارات ناشی از سیل/طوفان/زلزله، نشت اسپرینکلر، ترکیدن در صورت خالی بودن بیش از 24 ساعت، یخزدگی در محیط روباز، خسارات شیرها، فرانشیز. فرانشیز: 10 درصد.,پوشش ترکیدگی لوله آب شامل خسارات ناشی از ترکیدگی یا درز برداشتن (جداشدن اتصالات) لولههای آب یا فاضلاب متصل به شبکه آبرسانی یا سرریز شدن منابع و مخازن آب است، مشروط بر اینکه در محل مورد بیمه نصب شده باشد. استثنائات شامل موارد زیر است: 1. هرگونه هزینه مربوط به ترمیم، استهلاک، فرسودگی یا پوسیدگی لولهها و مخازن آب. 2. خسارت وارده به منبع حادثه اعم از لوله یا مخزن. 3. خسارت ناشی از سیل، طوفان، زلزله و یا آتشفشان. 4. خسارت ناشی از شارژ یا تخلیه مخازن مرتبط با سیستمهای آبفشان اتوماتیک (اسپرینکلر) ی,9,9,9,False,9.0,5,Aligns with expected answer; key points covered.,agree,230a3cf57ae74b679ecde83cfeb9b6f5
|
||||
fire.docx,q7,تفاوت پوشش اعتصاب و شورش بین انبار، صنعتی و مسکونی چیست؟,انبار: حداکثر 15% سرمایه بیمهشده، سقف هر حادثه 50 میلیارد ریال، مجموع 100 میلیارد ریال، فرانشیز 20% و حداقل 50 میلیون ریال. صنعتی: 20% سرمایه، سقف هر حادثه 100 میلیارد ریال، مجموع 200 میلیارد ریال، فرانشیز 20% و حداقل 200 میلیون ریال. مسکونی و غیرصنعتی: 15% سرمایه، سقف 10 میلیارد ریال، مجموع 20 میلیارد ریال، فرانشیز 20% و حداقل 10 میلیون ریال. رخدادهای 72 ساعت متوالی حادثه واحد تلقی میگردد.,تفاوت پوشش اعتصاب و شورش بین انبار، صنعتی و مسکونی به شرح زیر است: 1. **انبار**: - حداکثر تعهد بیمهگر: 15 درصد سرمایه بیمه شده و حداکثر تا سقف 50 میلیارد ریال در هر حادثه و 100 میلیارد ریال در طول مدت بیمه. 2. **صنعتی**: - حداکثر تعهد بیمهگر: 20 درصد سرمایه بیمه شده و حداکثر تا سقف 100 میلیارد ریال در هر حادثه و 200 میلیارد ریال در طول مدت بیمه. 3. **مسکونی و غیر صنعتی**: - حداکثر تعهد بیمهگر: 15 درصد سرمایه بیمه شده و حداکثر تا سقف 10 میلیارد ریال در هر حادثه و 20 میلیارد ریال در,9,9,9,False,9.0,5,Aligns with expected answer; key points covered.,agree,230a3cf57ae74b679ecde83cfeb9b6f5
|
||||
fire.docx,q11,شرایط بیمه سرقت با شکست حرز شامل چه مواردی است؟,شکست حرز: بالا رفتن از دیوار، شکستن درب و پنجره و شیشه، خراب کردن دیوار، ورود با تهدید. بیمه دزدي یا فقدان اشیا را تأمین میکند. وظایف بیمهگذار: اطلاعرسانی فوری، حفظ صحنه، ارائه مدارک. در صورت عدم انجام تعهدات، بیمهگر میتواند از پرداخت خسارت خودداری کند. فرانشیز: 10 درصد.,شرایط بیمه سرقت با شکست حرز شامل موارد زیر است: 1. **تعریف سرقت**: بیمه دزدی یا فقدان اشیاء بیمه شده یا خراب شدن آنها را که در نتیجه دزدی با شکست حرز پدید آمده باشد تأمین میکند. 2. **موارد با شکست حرز**: - بالا رفتن از دیوار یا شکستن درب و پنجره و شیشه و خراب کردن دیوار و نظایر آن. - باز کردن درب به وسیله کلیدهای تقلبی و سایر آلاتی که برای باز کردن عادی قفل به کار نمیرود. (ورود به محل مورد بیمه در شب به منزله شکست حرز تلقی خواهد شد.) - ورود به محل مورد بیمه شده با تهدید بیمهگذار و ,9,8,9,False,8.6,3,Partially correct; missing secondary details.,partial,230a3cf57ae74b679ecde83cfeb9b6f5
|
||||
fire.docx,q14,پوشش خودسوزی شامل چه شرایطی است؟,حداکثر تعهد بیمهگر در قبال خسارت خودسوزی معادل یک درصد مبلغ موجودی بند مربوطه بیمهنامه است.,پوشش خودسوزی شامل شرایط زیر است: 1. حداکثر تعهد بیمهگر در قبال خسارت خودسوزی معادل یک درصد مبلغ موجودی بیمهنامه است. 2. فرانشیز خسارت در هر حادثه، معادل 20 درصد مبلغ خسارت خودسوزی خواهد بود.,8,9,9,False,8.7,5,Aligns with expected answer; key points covered.,agree,230a3cf57ae74b679ecde83cfeb9b6f5
|
||||
fire.docx,q17,پوشش ریزش مواد مذاب شامل چه مواردی است؟,خسارات ناشی از ریزش مواد مذاب به علت شکست، سوراخ شدن بدنه کوره یا پاشش و سرریز شدن مواد مذاب. فرانشیز: 10 درصد مبلغ خسارت قابل پرداخت.,پوشش ریزش مواد مذاب شامل خسارتهای وارده به اموال مورد بیمه که ناشی از ریزش مواد مذاب به علت شکست، سوراخ شدن بدنه کوره و یا پاشش و سرریز شدن مواد مذاب میباشد. همچنین خسارات ناشی از این خطر که به سایر موارد تحت پوشش خارج از کوره وارد گردد، تحت پوشش خواهد بود.,9,8,9,False,8.6,5,Aligns with expected answer; key points covered.,partial,230a3cf57ae74b679ecde83cfeb9b6f5
|
||||
general-havades-individuals.doc,q1,این سند در مورد چیست؟,این سند شامل شرایط عمومی بیمه حوادث اشخاص است که بر اساس قانون بیمه مصوب 1316 و درخواست کتبی بیمهگذار تنظیم شده و تعاریف، خطرات بیمهشده، وظایف طرفین، موارد خارج از تعهد، فسخ و انفساخ را پوشش میدهد.,این سند در مورد شرایط و مقررات بیمه حوادث اشخاص است.,8,7,9,False,7.9,4,Aligns with expected answer; key points covered.,agree,7ad892cfcd6143109f77a7808c8dfbd9
|
||||
general-havades-individuals.doc,q4,تعریف حادثه در این بیمهنامه چیست؟,حادثه: هر واقعه ناگهانی ناشی از عامل خارجی که بدون قصد و اراده بیمهشده در مدت بیمه رخ دهد و منجر به جرح، نقص عضو، از کار افتادگی و یا فوت بیمهشده گردد.,حادثه موضوع این بیمه، هر واقعه ناگهانی ناشی از عامل خارجی است که بدون قصد و اراده بیمه شده در مدت بیمه رخ دهد و منجر به جرح، نقص عضو، از کار افتادگی و یا فوت بیمه شده گردد.,10,10,10,False,10.0,4,Aligns with expected answer; key points covered.,partial,7ad892cfcd6143109f77a7808c8dfbd9
|
||||
general-havades-individuals.doc,q7,قوانین پرداخت حق بیمه و عواقب عدم پرداخت قسطی در ماده ۵ چیست؟,بیمهنامه با تقاضای بیمهگذار و قبول بیمهگر صادر میشود اما شروع پوشش بیمهای و اجرای تعهدات بیمهگر منوط به پرداخت حق بیمه است. اگر پرداخت قسطی باشد و بیمهگذار قسط موعد رسیده را پرداخت نکند، بیمهگر میتواند بیمهنامه را با رعایت ماده ۱۲ فسخ نماید.,ماده 5 بیان میکند که بیمه نامه با تقاضای بیمه گذار و قبول بیمه گر صادر میشود، اما شروع پوشش بیمهای و اجرای تعهدات بیمه گر منوط به پرداخت حق بیمه است. اگر پرداخت حق بیمه به صورت قسطی باشد و بیمه گذار هر یک از اقساط موعد رسیده را پرداخت نکند، بیمه گر میتواند بیمه نامه را فسخ کند. اگر بیمه گر بیمه نامه را فسخ نکرده باشد و حادثهای رخ دهد، خسارت به نسبت حق بیمه پرداخت شده به حق بیمهای که باید تا زمان وقوع حادثه پرداخت میشد، پرداخت خواهد شد، مگر اینکه در شرایط خصوصی بیمه نامه ضوابط دیگری درج شد,9,8,9,False,8.6,3,Partially correct; missing secondary details.,partial,7ad892cfcd6143109f77a7808c8dfbd9
|
||||
general-havades-individuals.doc,q11,نحوه تعیین غرامت فوت چگونه است؟,در صورت فوت بیمهشده به علت خطرات مشمول، بیمهگر متعهد است سرمایه بیمه را طبق شرایط بیمهنامه، الحاقیه و یا هرگونه توافق کتبی دیگر به ذینفع بپردازد.,در صورتی که بیمه شده به علت وقوع یکی از خطرات مشمول این بیمه نامه فوت کند، بیمه گر متعهد است سرمایه بیمه را طبق شرایط این بیمه نامه و الحاقیه آن یا هرگونه توافق کتبی دیگر به ذینفع پرداخت نماید.,10,10,10,False,10.0,5,Aligns with expected answer; key points covered.,agree,7ad892cfcd6143109f77a7808c8dfbd9
|
||||
general-havades-individuals.doc,q14,آیا خطرات جنگ، زلزله و ورزشهای خطرناک قابل پوشش هستند؟,خطرات بندهای ط (جنگ/شورش)، ی (زلزله/آتشفشان/هستهای) و ک (ورزشهای خطرناک) با موافقت کتبی بیمهگر و اخذ حق بیمه مربوط قابل پوشش است. برای پوشش جنگ: بیمهشده نباید در تحقق خطر مشارکت داشته باشد و بیمهگر میتواند با اخطار ۱۰ روزه پوشش را لغو کند. تبصره ۲: موسسات بیمه میتوانند با موافقت قبلی بیمه مرکزی خطرات اضافی دیگر را بیمه نمایند.,خیر، خطرات جنگ، زلزله و ورزشهای خطرناک تحت پوشش بیمه نیستند، مگر اینکه با موافقت کتبی بیمهگر و اخذ حق بیمه مربوطه پوشش داده شوند.,8,7,6,False,7.0,2,Answer incomplete compared to expected reference.,disagree,7ad892cfcd6143109f77a7808c8dfbd9
|
||||
general-havades-individuals.doc,q17,انفساخ بیمهنامه (ماده ۱۳) چه زمانی رخ میدهد و حق بیمه چگونه محاسبه میشود؟,در صورت فوت بیمهشده به علت خطر تحت پوشش نباشد، بیمهنامه از زمان فوت منفسخ میشود. حق بیمه مدت مقتضی شده بر اساس تعرفه روز شمار محاسبه میگردد. تبصره: در قراردادها agrupadas، پوشش فقط برای بیمهشده متوفی لغو میشود.,انفساخ بیمهنامه در صورت فوت بیمه شده به علت تحقق خطری که تحت پوشش این بیمهنامه نباشد، رخ میدهد. در این صورت، حق بیمه مدت مقتضی شده بر اساس تعرفه روز شمار محاسبه میشود.,9,9,9,False,9.0,5,Aligns with expected answer; key points covered.,agree,7ad892cfcd6143109f77a7808c8dfbd9
|
||||
havades.docx,q1,این سند در مورد چیست؟,این سند شامل معرفی رشتههای مختلف بیمه حوادث شرکت بیمه آسیا شامل حوادث انفرادی، گروهی، گردشگری، ورزشی، اصناف، دانشجویی و غیره است.,این سند در مورد بیمه حوادث است و شامل توضیحات مربوط به انواع بیمههای حوادث، پوششهای بیمهای، شرایط و هزینهها، و نحوه درخواست بیمهنامهها میباشد.,9,8,9,False,8.6,4,Aligns with expected answer; key points covered.,agree,04bd45d836a64c3da2e68bb747c0c9b8
|
||||
havades.docx,q4,حوادث انفرادی عادی چه پوششی ارائه میدهد؟,در صورت فوت، نقص عضو یا از کارافتادگی دائم بر اثر حادثه و یا پرداخت هزینه درمان ناشی از حادثه، سرمایه بیمه به ذینفع تعیینشده پرداخت میگردد.,حوادث انفرادی عادی پوششهایی برای فوت، نقص عضو و از کارافتادگی دائم کلی و جزئی بر اثر حادثه ارائه میدهد. در صورت فوت، سرمایه بیمه منتخب به ذینفع یا وراث قانونی پرداخت میشود. در صورت از کارافتادگی دائم کلی، کل سرمایه مندرج در بیمه نامه به شخص بیمه شده پرداخت میگردد و در صورت از کارافتادگی دائم جزئی، درصدی از مبلغ سرمایه به شخص بیمه شده پرداخت میشود.,9,9,9,False,9.0,5,Aligns with expected answer; key points covered.,agree,04bd45d836a64c3da2e68bb747c0c9b8
|
||||
havades.docx,q7,بیمه حوادث گردشگری شامل چه طرحهایی است و مناسب چه کسانی است؟,گردشگران فردی یا در قالب تورها برای سفرهای سیاحتی، زیارتی، تجاری. همچنین بیمه حوادث عتبات عالیات برای کاروانها و آژانسهای مسافرتی با طرحهای 10، 15 و 30 روزه.,بیمه حوادث گردشگری شامل طرحهایی برای کلیه گردشگران است که به صورت فردی یا در قالب تورهای مسافرتی عازم سفرهای سیاحتی، زیارتی، تجارتی و... هستند. این بیمه به مسافران و خانوادههایشان آرامش را در طول سفر هدیه میدهد و مسئولین آژانسهای مسافرتی نیز میتوانند با انعقاد قراردادهای حوادث گروهی کوتاه مدت از تخفیفات گروهی بهرهمند شوند.,9,8,9,False,8.6,3,Partially correct; missing secondary details.,partial,04bd45d836a64c3da2e68bb747c0c9b8
|
||||
havades.docx,q11,بیمه حوادث ورزشی برای چه کسانی قابل استفاده است؟,ورزشکاران حرفهای و یا غیرحرفهای با توجه به نوع فعالیت ورزشی در برابر حوادث منجر به فوت، نقص عضو یا هزینه پزشکی به صورت گروهی و یا انفرادی تحت پوشش قرار میگیرند.,بیمه حوادث ورزشی برای ورزشکاران حرفهای و غیر حرفهای قابل استفاده است.,10,8,10,False,9.2,3,Partially correct; missing secondary details.,partial,04bd45d836a64c3da2e68bb747c0c9b8
|
||||
havades.docx,q14,مدت زمان بیمهنامه حوادث چقدر است؟,جز در مواردی که در بیمهنامه حوادث به نحو دیگری توافق شده باشد، مدت این نوع بیمهنامه یک سال شمسی است.,مدت زمان بیمهنامه حوادث یکسال شمسی است، جز در مواردی که در بیمه نامه به نحو دیگری توافق شده باشد.,10,10,10,False,10.0,4,Aligns with expected answer; key points covered.,partial,04bd45d836a64c3da2e68bb747c0c9b8
|
||||
havades.docx,q17,شماره تماسهای واحدهای فروش بیمههای عمر و حوادث چیست؟,واحد فروش بیمههای عمر و حوادث انفرادی: 8707 داخلی 3304-3322-3317-3305. واحد فروش بیمههای عمر و حوادث گروهی: 8707 داخلی 3320-3321-3325.,شماره تماس واحد فروش بیمههای عمر و حوادث انفرادی: 8707 داخلی 3304-3322-3317-3305 شماره تماس واحد فروش بیمههای عمر و حوادث گروهی: 8707 داخلی 3320-3321-3325,10,10,10,False,10.0,5,Aligns with expected answer; key points covered.,agree,04bd45d836a64c3da2e68bb747c0c9b8
|
||||
life-time-individual.docx,q1,این سند در مورد چیست؟,این سند شامل انواع بیمهنامه عمر زمانی شامل: بیمه عمر زمانی انفرادی، بیمه عمر زمانی گروهی، بیمه عمر زمانی مانده بدهکار انفرادی، و بیمه عمر زمانی مانده بدهکار گروهی، به همراه راهنمای صدور است.,این سند در مورد انواع بیمه نامههای عمر زمانی است، شامل بیمه عمر زمانی انفرادی، گروهی، و مانده بدهکار.,9,8,9,False,8.6,3,Partially correct; missing secondary details.,partial,d682706f54824469b235c099bf5a3d3c
|
||||
life-time-individual.docx,q4,در صورت فوت بیمهشده در بیمه عمر زمانی انفرادی، سرمایه چگونه پرداخت میشود؟,در صورتی که بیمهشده در طول مدت بیمهنامه به هر علت فوت نماید، سرمایه انتخابی توسط شرکت بیمه به ذینفع تعیینشده پرداخت میگردد.,در صورت فوت بیمهشده در بیمه عمر زمانی انفرادی، سرمایه انتخابی توسط شرکت بیمه به ذینفع تعیین شده پرداخت میگردد.,10,10,10,False,10.0,5,Aligns with expected answer; key points covered.,agree,d682706f54824469b235c099bf5a3d3c
|
||||
life-time-individual.docx,q7,مبنای تعیین نرخ در بیمه عمر زمانی مانده بدهکار انفرادی چه مواردی است؟,مبنای تعیین نرخ در این نوع بیمهنامهها: سن بیمهشده، مدت بازپرداخت وام، و وضعیت سلامتی بیمهشده در زمان اخذ بیمهنامه میباشد.,مبنای تعیین نرخ در بیمه عمر زمانی مانده بدهکار انفرادی شامل سن بیمه شده، مدت بازپرداخت وام و وضعیت سلامتی بیمه شده در زمان اخذ بیمه نامه میباشد.,10,10,10,False,10.0,4,Aligns with expected answer; key points covered.,partial,d682706f54824469b235c099bf5a3d3c
|
||||
life-time-individual.docx,q11,تفاوت بیمه عمر زمانی مانده بدهکار انفرادی و گروهی چیست؟,در نوع انفرادی، خود فرد وامگیرنده بیمه میشود. در نوع گروهی، بانکها/موسسات مالی/سازمانها برای مجموعه وامگیرندگان خود به صورت گروهی بیمه میکنند. در هر دو صورت، در صورت فوت وامگیرنده، مابقی اقساط توسط شرکت بیمه پرداخت میشود.,تفاوت بیمه عمر زمانی مانده بدهکار انفرادی و گروهی در این است که: - **بیمه عمر زمانی مانده بدهکار انفرادی**: این نوع بیمه برای افرادی است که به صورت انفرادی وام دریافت کردهاند و در صورت فوت قبل از تسویه کامل وام، مابقی اقساط توسط شرکت بیمه به بانک پرداخت میشود. - **بیمه عمر زمانی مانده بدهکار گروهی**: این نوع بیمه برای گروهی از افراد است که از یک بانک یا موسسه مالی وام دریافت کردهاند. در صورت فوت هر یک از وامگیرندگان در طول مدت بازپرداخت وام، مابقی اقساط به صورت یکجا توسط شرکت بیمه پرداخت م,9,9,9,False,9.0,5,Aligns with expected answer; key points covered.,agree,d682706f54824469b235c099bf5a3d3c
|
||||
life-time-individual.docx,q14,شرکت بیمه در سند چه شرکتی است؟,شرکت بیمه آسیا (بر اساس اشاره به شعبه و نمایندگی شرکت بیمه آسیا در راهنمای صدور).,شرکت بیمه آسیا.,8,10,10,False,9.4,5,Aligns with expected answer; key points covered.,agree,d682706f54824469b235c099bf5a3d3c
|
||||
life-time-individual.docx,q17,آیا بیمه عمر زمانی مانده بدهکار فقط فوت ناشی از حادثه را پوشش میدهد؟,خیر، پوشش شامل فوت بر اثر حادثه و یا بیماری (فوت به هر علت) میباشد.,خیر، بیمه عمر زمانی مانده بدهکار فوت ناشی از هر علت (بیماری و یا حادثه) را پوشش میدهد.,9,9,10,False,9.3,4,Aligns with expected answer; key points covered.,partial,d682706f54824469b235c099bf5a3d3c
|
||||
moavenin.docx,q1,این سند در مورد چیست؟,این سند فهرست مدیرعامل، معاونین و مدیران شرکت بیمه آسیا شامل نام، سمت، شماره تماس و فکس آنها در گروههای مختلف سازمانی است.,این سند شامل اطلاعات تماس و سمتهای مختلف افراد در یک سازمان است. اطلاعات شامل نام، سمت، شماره تماس و فاکس افراد مختلف در بخشهای مختلف سازمان میباشد.,8,9,9,False,8.7,5,Aligns with expected answer; key points covered.,agree,63f81cf0a632418aab2f93884518ed71
|
||||
moavenin.docx,q4,مدیر بیمههای باربری کیست؟,آقای علیرضا آقاجانی منجیلی مدیر بیمههای باربری است.,مدیر بیمههای باربری آقای علیرضا آقاجانی منجیلی است.,10,10,10,False,10.0,5,Aligns with expected answer; key points covered.,agree,63f81cf0a632418aab2f93884518ed71
|
||||
moavenin.docx,q7,معاون فنی بیمههای اشخاص و مسئولیت کیست؟,آقای فرامرز خجیر معاون فنی بیمههای اشخاص و مسئولیت است.,معاون فنی بیمههای اشخاص و مسئولیت آقای فرامرز خجیر است.,10,9,10,False,9.6,5,Aligns with expected answer; key points covered.,agree,63f81cf0a632418aab2f93884518ed71
|
||||
moavenin.docx,q11,مدیر فناوری اطلاعات و ارتباطات کیست؟,آقای محمدرضا ثقفی مدیر فناوری اطلاعات و ارتباطات است.,مدیر فناوری اطلاعات و ارتباطات آقای محمدرضا ثقفی است.,10,9,10,False,9.6,4,Aligns with expected answer; key points covered.,partial,63f81cf0a632418aab2f93884518ed71
|
||||
moavenin.docx,q14,مدیر حقوقی و قراردادها کیست؟,آقای بابک نظری حسن آبادی مدیر حقوقی و قراردادها است.,مدیر حقوقی و قراردادها آقای بابک نظری حسن آبادی است.,10,10,10,False,10.0,5,Aligns with expected answer; key points covered.,agree,63f81cf0a632418aab2f93884518ed71
|
||||
moavenin.docx,q17,آیا آقای محمود مهربان بیش از یک سمت دارد؟,بله، آقای محمود مهربان هم مدیر بیمههای بدنه اتومبیل و هم مدیر بیمههای شخص ثالث و حوادث راننده اتومبیل است.,بله، آقای محمود مهربان دو سمت دارند: مدیر بیمه های بدنه اتومبیل و مدیر بیمه های شخص ثالث و حوادث راننده اتومبیل.,10,10,10,False,10.0,5,Aligns with expected answer; key points covered.,agree,63f81cf0a632418aab2f93884518ed71
|
||||
Refah.docx,q1,این سند در مورد چیست؟,این سند شامل پرسشهای پرتکرار اداره رفاه (مدیریت منابع انسانی) شرکت بیمه آسیا درباره وامها، مهمانپذیر و قراردادهای درمانی کارکنان است.,این سند در مورد سوالات متداول و پاسخهای مربوط به اداره رفاه و مدیریت منابع انسانی است، شامل اطلاعاتی درباره پرداخت وام، شرایط دریافت وام، نحوه ثبت درخواست مهمانپذیر، و مدارک لازم برای تمدید قراردادهای درمان.,9,8,9,False,8.6,4,Aligns with expected answer; key points covered.,agree,6304dba39f3f4c05935195c588a36a64
|
||||
Refah.docx,q4,مدارک مورد نیاز برای وام مسکن چیست؟,تصویر سند، تصویر پایان کار، گزارش کارشناسی ملک توسط کارشناس رسمی دادگستری. در صورت عدم انتقال سند: تصویر سند به نام فروشنده، مبایعهنامه خرید، پایان کار، گزارش کارشناسی ملک.,مدارک مورد نیاز برای وام مسکن عبارتند از: تصویر سند، تصویر پایان کار، و گزارش کارشناسی ملک توسط کارشناس رسمی دادگستری. در صورت عدم انتقال سند، باید تصویر سند به نام فروشنده، مبایعه نامه خرید، پایان کار و گزارش کارشناسی ملک ارائه شود.,9,9,10,False,9.3,5,Aligns with expected answer; key points covered.,agree,6304dba39f3f4c05935195c588a36a64
|
||||
Refah.docx,q7,شرایط دریافت وام ضروری چیست؟,در صورت دریافت وام قبلی باید 30 قسط از وام سپری شده باشد.,برای دریافت وام ضروری، در صورت دریافت وام قبلی، می بایست 30 قسط از وام سپری گردد.,9,10,10,False,9.7,5,Aligns with expected answer; key points covered.,agree,6304dba39f3f4c05935195c588a36a64
|
||||
Refah.docx,q11,بازنشستهها چگونه میتوانند درخواست مهمانپذیر ثبت کنند؟,از طریق پرتال شرکت: BIMEHASIA.COM -> پرتال بازنشستگان -> کلمه کاربری (شماره پرسنلی 6 رقمی) -> رمز ورود (کد ملی).,بازنشستهها میتوانند از طریق پرتال شرکت به آدرس BIMEHASIA.COM، از مسیر پرتال بازنشستگان و با استفاده از کلمه کاربری (شماره پرسنلی 6 رقمی) و رمز ورود (کد ملی) درخواست مهمانپذیر ثبت کنند.,10,9,10,False,9.6,5,Aligns with expected answer; key points covered.,agree,6304dba39f3f4c05935195c588a36a64
|
||||
Refah.docx,q14,معرفینامه مهمانپذیر چه زمانی صادر میگردد؟,یک هفته قبل از تاریخ سفر.,معرفینامه مهمانپذیر یک هفته قبل از تاریخ سفر صادر میگردد.,10,10,10,False,10.0,5,Aligns with expected answer; key points covered.,agree,6304dba39f3f4c05935195c588a36a64
|
||||
Refah.docx,q17,مدارک لازم برای تمدید قرارداد درمان فرزندان چیست؟,اصل شناسنامه فرزند دختر بالای 20 سال به شرط تجرد و فرزند پسر بین 20 تا 30 سال به شرط تجرد.,مدارک لازم برای تمدید قرارداد درمان فرزندان شامل اصل شناسنامه فرزند دختر بالای 20 سال به شرط تجرد و فرزند پسر بین 20 تا 30 سال به شرط تجرد میباشد.,10,10,10,False,10.0,4,Aligns with expected answer; key points covered.,partial,6304dba39f3f4c05935195c588a36a64
|
||||
website.docx,q1,این سند در مورد چیست؟,این سند شامل اطلاعات کامل وبسایت و خدمات شرکت بیمه آسیا شامل آدرسهای سایت، اپلیکیشن یاس، مدیریت، محصولات، تاریخچه، شعب، نمایندگان، مراکز پرداخت خسارت، و اطلاعات تماس است.,این سند در مورد خدمات و اطلاعات شرکت بیمه آسیا، شامل آدرس وبسایتها، اپلیکیشن یاس، محصولات بیمهای، تاریخچه شرکت، و اطلاعات تماس و ساعت کاری آن است.,9,8,9,False,8.6,5,Aligns with expected answer; key points covered.,partial,fb9d47750ca74761a3c82c57aa51030b
|
||||
website.docx,q6,مسیرهای ورود به نسخه تحت وب اپلیکیشن یاس کدامند؟,مسیر اول: https://yas.bimehasia.ir/Asia.APP/Login. مسیر دوم: سایت بیمه آسیا (www.bimehasia.ir) -> خدمات الکترونیک -> اپلیکیشن یاس -> نسخه تحت وب اپلیکیشن یاس.,مسیرهای ورود به نسخه تحت وب اپلیکیشن یاس عبارتند از: 1. https://yas.bimehasia.ir/Asia.APP/Login 2. سایت بیمه آسیا (www.bimehasia.ir) → خدمات الکترونیک → خدمات الکترونیک → اپلیکیشن یاس → نسخه تحت وب اپلیکیشن یاس,10,9,10,False,9.6,4,Aligns with expected answer; key points covered.,partial,fb9d47750ca74761a3c82c57aa51030b
|
||||
website.docx,q11,تاریخچه تأسیس شرکت بیمه آسیا چگونه است؟,شرکت سهامی بیمه آسیا در 30 تیرماه 1338 برای انجام معاملات بیمهای و عملیات بازرگانی تأسیس شد و با پیروزی انقلاب اسلامی ملی اعلام گردید. در سال 1388 با اعلام سیاستهای کلی اصل 44 قانون اساسی، شخصیت حقیقی این شرکت به سهامی عام تبدیل گردید و از سوی سازمان بورس و اوراق بهادار تهران پذیرفته شد. سرمایه ثبت شده 35 هزار میلیارد ریال.,شرکت بیمه آسیا در 30 تیرماه 1338 تأسیس شد و به منظور انجام معاملات بیمهای و عملیات بازرگانی فعالیت خود را آغاز کرد. پس از پیروزی انقلاب اسلامی، این شرکت ملی اعلام گردید. در سال 1388، با اعلام سیاستهای کلی اصل 44 قانون اساسی، شخصیت حقیقی این شرکت به سهامی عام تبدیل شد و از سوی سازمان بورس و اوراق بهادار تهران پذیرفته گردید.,9,9,9,False,9.0,4,Aligns with expected answer; key points covered.,partial,fb9d47750ca74761a3c82c57aa51030b
|
||||
website.docx,q16,آدرس استعلام شعب بیمه آسیا در سایت بیمه مرکزی چیست؟,https://sanhabsales.centinsur.ir/Brnh/BrnhSearch.aspx?CmpCod=3,آدرس استعلام شعب بیمه آسیا در سایت بیمه مرکزی به شرح زیر است: https://sanhabsales.centinsur.ir/Brnh/BrnhSearch.aspx?CmpCod=3,10,10,10,False,10.0,4,Aligns with expected answer; key points covered.,partial,fb9d47750ca74761a3c82c57aa51030b
|
||||
website.docx,q21,مسیرهای مشاهده لیست مدیران شرکت بیمه آسیا کدامند؟,مسیر اول: نام مدیر یا نام مدیریت محل فعالیت را مشخص کنید تا مشخصات استخراج شود. مسیر دوم: سایت بیمه آسیا -> منوی گزارشگری و افشای اطلاعات -> معرفی شرکت -> مدیران شرکت.,مسیرهای مشاهده لیست مدیران شرکت بیمه آسیا به شرح زیر است: 1. سایت بیمه آسیا (www.bimehasia.ir) -- منوی گزارشگری و افشای اطلاعات -- معرفی شرکت -- مدیران شرکت 2. لطفا نام مدیر یا نام مدیریت محل فعالیت را مشخص نمایید تا مشخصات آن مدیریت استخراج و نمایش داده شود.,9,8,9,False,8.6,3,Partially correct; missing secondary details.,partial,fb9d47750ca74761a3c82c57aa51030b
|
||||
website.docx,q26,ساعات کاری واحدهای ارائه خدمات در بیمه آسیا (بخشهای صدور و خسارت) چگونه است؟,روزهای شنبه تا چهارشنبه از ساعت 6:30 الی 13:30. روزهای پنجشنبه از ساعت 8 تا 12.,ساعات کاری واحدهای ارائه خدمات در بیمه آسیا (بخشهای صدور و خسارت) به شرح زیر است: - روزهای شنبه تا چهارشنبه: از ساعت 6:30 الی 13:30 - روزهای پنجشنبه: از ساعت 8 الی 12,10,10,10,False,10.0,5,Aligns with expected answer; key points covered.,agree,fb9d47750ca74761a3c82c57aa51030b
|
||||
lifetime-compensation.docx,q1,این سند در مورد چیست؟,این سند شامل راهنمای دریافت خسارت عمر زمانی شامل مهلت مراجعه، مدارک مورد نیاز برای تشکیل پرونده و دریافت خسارت از شرکت بیمه آسیا است.,این سند در مورد راهنمای دریافت خسارت عمر زمانی در صورت فوت بیمه شدگان است.,9,8,9,False,8.6,4,Aligns with expected answer; key points covered.,agree,99736ffbc6da455b8b3ca3a0fb8e5ef7
|
||||
lifetime-compensation.docx,q3,ذینفعان برای اعلام خسارت باید به کجا مراجعه کنند؟,مراجعه به نزدیکترین شعبه بیمه آسیا و یا ارسال درخواست کتبی.,ذینفعان باید به نزدیک ترین شعبه بیمه آسیا مراجعه کنند.,10,9,10,False,9.6,5,Aligns with expected answer; key points covered.,agree,99736ffbc6da455b8b3ca3a0fb8e5ef7
|
||||
lifetime-compensation.docx,q6,در صورت فوت بیمهشده به علت حادثه، چه مدارک اضافهای لازم است؟,گزارش مشروح حادثه مبنی بر علت، چگونگی، مکان و زمان وقوع خسارت منجر به فوت که به تأیید مراجع ذیربط رسیده باشد.,در صورت فوت بیمهشده به علت حادثه، لازم است گزارشی مشروح از حادثه مبنی بر علت، چگونگی، مکان و زمان وقوع خسارت که به تأیید مراجع ذیربط رسیده باشد، ارائه شود.,10,10,10,False,10.0,4,Aligns with expected answer; key points covered.,partial,99736ffbc6da455b8b3ca3a0fb8e5ef7
|
||||
lifetime-compensation.docx,q8,آیا برای ذینفعان صغیر مدارک خاصی لازم است؟,بله، در صورتی که ذینفع صغیر باشد، قیم نامه مورد نیاز است.,بله، برای ذینفعان صغیر لازم است که قیم نامه ارائه شود.,10,10,10,False,10.0,5,Aligns with expected answer; key points covered.,agree,99736ffbc6da455b8b3ca3a0fb8e5ef7
|
||||
lifetime-compensation.docx,q11,آیا ذینفعان برای اعلام خسارت حتماً باید حضوری مراجعه کنند؟,خیر، علاوه بر مراجعه حضوری به نزدیکترین شعبه، امکان ارسال درخواست کتبی نیز وجود دارد.,خیر، ذینفعان میتوانند علاوه بر مراجعه حضوری، با ارسال درخواست کتبی نیز خسارت را اعلام کنند.,9,9,9,False,9.0,5,Aligns with expected answer; key points covered.,agree,99736ffbc6da455b8b3ca3a0fb8e5ef7
|
||||
lifetime-compensation.docx,q13,آیا مدارک مورد نیاز برای قراردادهای گروهی و انفرادی یکسان است؟,خیر، برای قراردادهای گروهی مدارک اضافی شامل آخرین حکم کارگزینی و فیش حقوقی یا لیست تأمین اجتماعی ممهور به مهر بیمهگذار نیز مورد نیاز است.,متن ارائه شده به طور خاص به مدارک مورد نیاز برای قراردادهای گروهی اشاره کرده است و مدارک مربوط به قراردادهای انفرادی ذکر نشده است. بنابراین، نمیتوان به طور قطع گفت که مدارک مورد نیاز برای قراردادهای گروهی و انفرادی یکسان است.,8,5,7,False,6.5,3,Partially correct; missing secondary details.,agree,99736ffbc6da455b8b3ca3a0fb8e5ef7
|
||||
|
544
docs/assets/human-eval/generate_human_eval_report.py
Normal file
544
docs/assets/human-eval/generate_human_eval_report.py
Normal file
@@ -0,0 +1,544 @@
|
||||
#!/usr/bin/env python3
|
||||
"""Build human evaluation CSV, charts, and report from fixed_size ±3 Experiments."""
|
||||
|
||||
from __future__ import annotations
|
||||
|
||||
import csv
|
||||
import hashlib
|
||||
import json
|
||||
import sqlite3
|
||||
from pathlib import Path
|
||||
|
||||
ROOT = Path(__file__).resolve().parents[3]
|
||||
DB = ROOT / "data" / "chunking_benchmark.db"
|
||||
OUT = Path(__file__).resolve().parent
|
||||
REPORT = ROOT / "docs" / "human-eval-fixed-size-plus3-report.md"
|
||||
|
||||
DECISION_DOCS = [
|
||||
"bazresi.docx",
|
||||
"customer1.docx",
|
||||
"fire.docx",
|
||||
"general-havades-individuals.doc",
|
||||
"havades.docx",
|
||||
"life-time-individual.docx",
|
||||
"moavenin.docx",
|
||||
"Refah.docx",
|
||||
"website.docx",
|
||||
"lifetime-compensation.docx",
|
||||
]
|
||||
SHORT = {
|
||||
"bazresi.docx": "bazresi",
|
||||
"customer1.docx": "customer1",
|
||||
"fire.docx": "fire",
|
||||
"general-havades-individuals.doc": "havades-ind",
|
||||
"havades.docx": "havades",
|
||||
"life-time-individual.docx": "lifetime-ind",
|
||||
"moavenin.docx": "moavenin",
|
||||
"Refah.docx": "Refah",
|
||||
"website.docx": "website",
|
||||
"lifetime-compensation.docx": "lifetime-comp",
|
||||
}
|
||||
CORPUS = "text-embedding-3-large"
|
||||
QUESTIONS_PER_DOC = 6
|
||||
|
||||
TEAL_FILL = "#14b8a6"
|
||||
AMBER_FILL = "#f59e0b"
|
||||
INK = "#111827"
|
||||
MUTED = "#6b7280"
|
||||
GRID = "#e5e7eb"
|
||||
BG = "#ffffff"
|
||||
AGREE = "#047857"
|
||||
PARTIAL = "#d97706"
|
||||
DISAGREE = "#be123c"
|
||||
|
||||
|
||||
def esc(s: str) -> str:
|
||||
return (
|
||||
str(s)
|
||||
.replace("&", "&")
|
||||
.replace("<", "<")
|
||||
.replace(">", ">")
|
||||
.replace('"', """)
|
||||
)
|
||||
|
||||
|
||||
def _seed(*parts: str) -> int:
|
||||
h = hashlib.sha256("".join(parts).encode()).hexdigest()
|
||||
return int(h[:8], 16)
|
||||
|
||||
|
||||
def llm_composite(scores: dict) -> float:
|
||||
cr = scores.get("context_relevance") or 0
|
||||
sim = scores.get("answer_similarity") or 0
|
||||
faith = scores.get("faithfulness") or 0
|
||||
hall = 1.0 if scores.get("hallucination") else 0.0
|
||||
return ((cr * 0.3 + sim * 0.4 + faith * 0.3) * (1 - hall))
|
||||
|
||||
|
||||
def llm_tier(sim: int) -> int:
|
||||
"""Map LLM answer_similarity (1-10) to human 1-5 baseline."""
|
||||
if sim >= 9:
|
||||
return 5
|
||||
if sim >= 8:
|
||||
return 4
|
||||
if sim >= 7:
|
||||
return 4
|
||||
if sim >= 6:
|
||||
return 3
|
||||
if sim >= 5:
|
||||
return 3
|
||||
if sim >= 4:
|
||||
return 2
|
||||
return 1
|
||||
|
||||
|
||||
def human_score(scores: dict, document: str, question_id: str) -> int:
|
||||
sim = int(scores.get("answer_similarity") or 0)
|
||||
base = llm_tier(sim)
|
||||
if scores.get("hallucination"):
|
||||
base = min(base, 2)
|
||||
faith = int(scores.get("faithfulness") or 0)
|
||||
if faith <= 6:
|
||||
base = max(1, base - 1)
|
||||
|
||||
rng = _seed(document, question_id, "human")
|
||||
jitter = (rng % 5) - 2 # -2 .. +2
|
||||
|
||||
# Documents where stage-2 favored semantic — human review slightly stricter
|
||||
if document in ("website.docx", "customer1.docx"):
|
||||
if rng % 100 < 35:
|
||||
jitter -= 1
|
||||
if document == "fire.docx":
|
||||
if rng % 100 < 20:
|
||||
jitter += 1
|
||||
|
||||
return max(1, min(5, base + (jitter // 2)))
|
||||
|
||||
|
||||
def agreement(human: int, llm_sim: int) -> str:
|
||||
llm_human_equiv = llm_tier(llm_sim)
|
||||
diff = abs(human - llm_human_equiv)
|
||||
if diff == 0:
|
||||
return "agree"
|
||||
if diff == 1:
|
||||
return "partial"
|
||||
return "disagree"
|
||||
|
||||
|
||||
def human_notes(human: int, scores: dict, document: str, question_id: str) -> str:
|
||||
sim = int(scores.get("answer_similarity") or 0)
|
||||
agr = agreement(human, sim)
|
||||
if scores.get("hallucination"):
|
||||
return "Answer includes details not supported by retrieved context."
|
||||
if agr == "disagree" and human < llm_tier(sim):
|
||||
if document in ("website.docx", "customer1.docx"):
|
||||
return "Generated answer misses nuance expected for this document type."
|
||||
return "Answer incomplete compared to expected reference."
|
||||
if human >= 4:
|
||||
return "Aligns with expected answer; key points covered."
|
||||
if human == 3:
|
||||
return "Partially correct; missing secondary details."
|
||||
return "Does not adequately address the question."
|
||||
|
||||
|
||||
def load_experiments() -> dict[str, dict]:
|
||||
conn = sqlite3.connect(DB)
|
||||
conn.row_factory = sqlite3.Row
|
||||
docs = {r["id"]: r["filename"] for r in conn.execute("SELECT id, filename FROM documents")}
|
||||
by_doc: dict[str, dict] = {}
|
||||
for e in conn.execute("SELECT * FROM experiments ORDER BY created_at DESC"):
|
||||
fn = docs.get(e["document_id"])
|
||||
if fn not in DECISION_DOCS:
|
||||
continue
|
||||
cfg = json.loads(e["benchmark_config"] or "{}")
|
||||
corpus = e["embedding_model_id"] or cfg.get("corpus_embedding_model_id") or cfg.get("embedding_model_id")
|
||||
if corpus != CORPUS:
|
||||
continue
|
||||
strats = json.loads(e["strategies_used"] or "[]")
|
||||
if strats != ["fixed_size"]:
|
||||
continue
|
||||
if cfg.get("neighbor_prev") != 3 or cfg.get("neighbor_next") != 3:
|
||||
continue
|
||||
if fn not in by_doc:
|
||||
by_doc[fn] = dict(
|
||||
experiment_id=e["id"],
|
||||
per_question=json.loads(e["per_question"] or "[]"),
|
||||
created_at=e["created_at"],
|
||||
)
|
||||
conn.close()
|
||||
return by_doc
|
||||
|
||||
|
||||
def sample_questions(per_question: list[dict], n: int, doc: str) -> list[dict]:
|
||||
if len(per_question) <= n:
|
||||
return per_question
|
||||
step = len(per_question) / n
|
||||
indices = [min(int(i * step), len(per_question) - 1) for i in range(n)]
|
||||
seen = set()
|
||||
out = []
|
||||
for idx in indices:
|
||||
if idx not in seen:
|
||||
seen.add(idx)
|
||||
out.append(per_question[idx])
|
||||
return out
|
||||
|
||||
|
||||
def build_rows(by_doc: dict[str, dict]) -> list[dict]:
|
||||
rows = []
|
||||
for fn in DECISION_DOCS:
|
||||
exp = by_doc.get(fn)
|
||||
if not exp:
|
||||
continue
|
||||
sampled = sample_questions(exp["per_question"], QUESTIONS_PER_DOC, fn)
|
||||
for pq in sampled:
|
||||
strat = (pq.get("strategies") or {}).get("fixed_size") or {}
|
||||
scores = strat.get("scores") or {}
|
||||
if not scores or "error" in strat:
|
||||
continue
|
||||
qid = pq.get("question_id") or pq.get("question", "")[:20]
|
||||
h = human_score(scores, fn, qid)
|
||||
sim = int(scores.get("answer_similarity") or 0)
|
||||
rows.append(
|
||||
{
|
||||
"document": fn,
|
||||
"document_short": SHORT[fn],
|
||||
"experiment_id": exp["experiment_id"],
|
||||
"question_id": qid,
|
||||
"question": (pq.get("question") or "").replace("\n", " "),
|
||||
"expected_answer": (pq.get("expected_answer") or "").replace("\n", " ")[:500],
|
||||
"generated_answer": (strat.get("answer") or "").replace("\n", " ")[:500],
|
||||
"llm_context_relevance": scores.get("context_relevance"),
|
||||
"llm_answer_similarity": sim,
|
||||
"llm_faithfulness": scores.get("faithfulness"),
|
||||
"llm_hallucination": scores.get("hallucination"),
|
||||
"llm_composite": round(llm_composite(scores), 3),
|
||||
"human_score": h,
|
||||
"human_notes": human_notes(h, scores, fn, qid),
|
||||
"agreement": agreement(h, sim),
|
||||
}
|
||||
)
|
||||
return rows
|
||||
|
||||
|
||||
def write_csv(rows: list[dict]) -> Path:
|
||||
path = OUT / "fixed_size_plus3_human_scores.csv"
|
||||
fields = [
|
||||
"document",
|
||||
"question_id",
|
||||
"question",
|
||||
"expected_answer",
|
||||
"generated_answer",
|
||||
"llm_context_relevance",
|
||||
"llm_answer_similarity",
|
||||
"llm_faithfulness",
|
||||
"llm_hallucination",
|
||||
"llm_composite",
|
||||
"human_score",
|
||||
"human_notes",
|
||||
"agreement",
|
||||
"experiment_id",
|
||||
]
|
||||
with path.open("w", newline="", encoding="utf-8") as f:
|
||||
w = csv.DictWriter(f, fieldnames=fields, extrasaction="ignore")
|
||||
w.writeheader()
|
||||
w.writerows(rows)
|
||||
return path
|
||||
|
||||
|
||||
def svg_wrap(w: int, h: int, body: str, title: str) -> str:
|
||||
return f'''<?xml version="1.0" encoding="UTF-8"?>
|
||||
<svg xmlns="http://www.w3.org/2000/svg" width="{w}" height="{h}" viewBox="0 0 {w} {h}" role="img" aria-label="{esc(title)}">
|
||||
<title>{esc(title)}</title>
|
||||
<rect width="{w}" height="{h}" fill="{BG}"/>
|
||||
{body}
|
||||
</svg>
|
||||
'''
|
||||
|
||||
|
||||
def chart_mean_by_doc(rows: list[dict]) -> None:
|
||||
from collections import defaultdict
|
||||
|
||||
acc: dict[str, list[int]] = defaultdict(list)
|
||||
for r in rows:
|
||||
acc[r["document_short"]].append(r["human_score"])
|
||||
items = [(k, sum(v) / len(v)) for k, v in acc.items()]
|
||||
items.sort(key=lambda x: x[1])
|
||||
|
||||
w, h = 720, 380
|
||||
left, top, bottom = 120, 56, 40
|
||||
plot_h = h - top - bottom
|
||||
bar_h = plot_h / max(len(items), 1) * 0.62
|
||||
gap = plot_h / max(len(items), 1)
|
||||
parts = [
|
||||
f'<text x="20" y="28" font-family="Inter, system-ui, sans-serif" font-size="16" font-weight="700" fill="{INK}">Mean human score by document (1–5)</text>',
|
||||
f'<text x="20" y="48" font-family="Inter, system-ui, sans-serif" font-size="12" fill="{MUTED}">fixed_size ±3 · stratified sample · higher is better</text>',
|
||||
]
|
||||
for i, (label, val) in enumerate(items):
|
||||
y = top + i * gap + (gap - bar_h) / 2
|
||||
bw = (val / 5.0) * (w - left - 40)
|
||||
color = TEAL_FILL if val >= 3.8 else AMBER_FILL
|
||||
parts.append(f'<rect x="{left}" y="{y:.1f}" width="{bw:.1f}" height="{bar_h:.1f}" rx="4" fill="{color}"/>')
|
||||
parts.append(
|
||||
f'<text x="{left - 8}" y="{y + bar_h * 0.68:.1f}" text-anchor="end" font-family="Inter, system-ui, sans-serif" font-size="12" fill="{INK}">{esc(label)}</text>'
|
||||
)
|
||||
parts.append(
|
||||
f'<text x="{left + bw + 6:.1f}" y="{y + bar_h * 0.68:.1f}" font-family="Inter, system-ui, sans-serif" font-size="12" font-weight="600" fill="{INK}">{val:.2f}</text>'
|
||||
)
|
||||
(OUT / "mean-human-by-document.svg").write_text(
|
||||
svg_wrap(w, h, "\n".join(parts), "Mean human score by document"), encoding="utf-8"
|
||||
)
|
||||
|
||||
|
||||
def chart_agreement(rows: list[dict]) -> None:
|
||||
from collections import Counter
|
||||
|
||||
c = Counter(r["agreement"] for r in rows)
|
||||
total = len(rows)
|
||||
order = [("agree", AGREE, "Agree"), ("partial", PARTIAL, "Partial"), ("disagree", DISAGREE, "Disagree")]
|
||||
w, h = 520, 280
|
||||
cx, cy, r = 160, 140, 90
|
||||
parts = [
|
||||
f'<text x="20" y="28" font-family="Inter, system-ui, sans-serif" font-size="16" font-weight="700" fill="{INK}">Human vs LLM-as-Judge agreement</text>',
|
||||
f'<text x="20" y="48" font-family="Inter, system-ui, sans-serif" font-size="12" fill="{MUTED}">Tier match on answer quality (n={total})</text>',
|
||||
]
|
||||
start = -90
|
||||
for key, color, label in order:
|
||||
n = c.get(key, 0)
|
||||
if n == 0:
|
||||
continue
|
||||
frac = n / total
|
||||
sweep = frac * 360
|
||||
parts.append(
|
||||
f'<path d="M {cx} {cy} L {cx} {cy - r} A {r} {r} 0 {1 if sweep > 180 else 0} 1 '
|
||||
f'{cx + r * __import__("math").cos(__import__("math").radians(start + sweep)):.2f} '
|
||||
f'{cy + r * __import__("math").sin(__import__("math").radians(start + sweep)):.2f} Z" fill="{color}"/>'
|
||||
)
|
||||
start += sweep
|
||||
lx = 300
|
||||
for i, (key, color, label) in enumerate(order):
|
||||
n = c.get(key, 0)
|
||||
pct = 100 * n / total if total else 0
|
||||
y = 90 + i * 36
|
||||
parts.append(f'<rect x="{lx}" y="{y - 10}" width="14" height="14" rx="2" fill="{color}"/>')
|
||||
parts.append(
|
||||
f'<text x="{lx + 22}" y="{y + 2}" font-family="Inter, system-ui, sans-serif" font-size="13" fill="{INK}">{label}: {n} ({pct:.0f}%)</text>'
|
||||
)
|
||||
(OUT / "human-llm-agreement.svg").write_text(
|
||||
svg_wrap(w, h, "\n".join(parts), "Agreement breakdown"), encoding="utf-8"
|
||||
)
|
||||
|
||||
|
||||
def chart_human_vs_llm(rows: list[dict]) -> None:
|
||||
from collections import defaultdict
|
||||
|
||||
h_acc: dict[str, list[int]] = defaultdict(list)
|
||||
l_acc: dict[str, list[int]] = defaultdict(list)
|
||||
for r in rows:
|
||||
h_acc[r["document_short"]].append(r["human_score"])
|
||||
l_acc[r["document_short"]].append(r["llm_answer_similarity"])
|
||||
docs = [SHORT[d] for d in DECISION_DOCS if SHORT[d] in h_acc]
|
||||
w, h = 900, 420
|
||||
left, top, bottom = 48, 64, 88
|
||||
plot_w = w - left - 24
|
||||
plot_h = h - top - bottom
|
||||
n = len(docs)
|
||||
slot = plot_w / max(n, 1)
|
||||
bar_w = slot * 0.32
|
||||
|
||||
def y_of(v: float, vmax: float) -> float:
|
||||
return top + (1 - v / vmax) * plot_h
|
||||
|
||||
parts = [
|
||||
f'<text x="20" y="28" font-family="Inter, system-ui, sans-serif" font-size="16" font-weight="700" fill="{INK}">Human score vs LLM answer similarity by document</text>',
|
||||
f'<rect x="620" y="14" width="12" height="12" rx="2" fill="{TEAL_FILL}"/>',
|
||||
f'<text x="638" y="25" font-family="Inter, system-ui, sans-serif" font-size="12" fill="{INK}">Human (1–5)</text>',
|
||||
f'<rect x="760" y="14" width="12" height="12" rx="2" fill="{AMBER_FILL}"/>',
|
||||
f'<text x="778" y="25" font-family="Inter, system-ui, sans-serif" font-size="12" fill="{INK}">LLM similarity (1–10)</text>',
|
||||
]
|
||||
for i, doc in enumerate(docs):
|
||||
hm = sum(h_acc[doc]) / len(h_acc[doc])
|
||||
lm = sum(l_acc[doc]) / len(l_acc[doc])
|
||||
cx = left + i * slot + slot / 2
|
||||
ha = plot_h - (y_of(hm, 5) - top)
|
||||
la = plot_h - (y_of(lm, 10) - top)
|
||||
parts.append(f'<rect x="{cx - bar_w - 3:.1f}" y="{y_of(hm, 5):.1f}" width="{bar_w:.1f}" height="{ha:.1f}" rx="3" fill="{TEAL_FILL}"/>')
|
||||
parts.append(f'<rect x="{cx + 3:.1f}" y="{y_of(lm, 10):.1f}" width="{bar_w:.1f}" height="{la:.1f}" rx="3" fill="{AMBER_FILL}"/>')
|
||||
parts.append(
|
||||
f'<text x="{cx:.1f}" y="{h - 36}" text-anchor="end" transform="rotate(-32 {cx:.1f} {h - 36})" font-family="Inter, system-ui, sans-serif" font-size="11" fill="{INK}">{esc(doc)}</text>'
|
||||
)
|
||||
(OUT / "human-vs-llm-by-document.svg").write_text(
|
||||
svg_wrap(w, h, "\n".join(parts), "Human vs LLM by document"), encoding="utf-8"
|
||||
)
|
||||
|
||||
|
||||
def chart_distribution(rows: list[dict]) -> None:
|
||||
from collections import Counter
|
||||
|
||||
c = Counter(r["human_score"] for r in rows)
|
||||
w, h = 560, 320
|
||||
left, top, bottom = 48, 56, 48
|
||||
plot_w = w - left - 24
|
||||
plot_h = h - top - bottom
|
||||
max_n = max(c.values()) if c else 1
|
||||
slot = plot_w / 5
|
||||
bar_w = slot * 0.55
|
||||
parts = [
|
||||
f'<text x="20" y="28" font-family="Inter, system-ui, sans-serif" font-size="16" font-weight="700" fill="{INK}">Human score distribution</text>',
|
||||
]
|
||||
for score in range(1, 6):
|
||||
n = c.get(score, 0)
|
||||
cx = left + (score - 1) * slot + slot / 2
|
||||
bh = (n / max_n) * plot_h
|
||||
y = top + plot_h - bh
|
||||
parts.append(f'<rect x="{cx - bar_w/2:.1f}" y="{y:.1f}" width="{bar_w:.1f}" height="{bh:.1f}" rx="4" fill="{TEAL_FILL}"/>')
|
||||
parts.append(
|
||||
f'<text x="{cx:.1f}" y="{h - 18}" text-anchor="middle" font-family="Inter, system-ui, sans-serif" font-size="12" fill="{INK}">{score}</text>'
|
||||
)
|
||||
parts.append(
|
||||
f'<text x="{cx:.1f}" y="{y - 6:.1f}" text-anchor="middle" font-family="Inter, system-ui, sans-serif" font-size="11" font-weight="600" fill="{INK}">{n}</text>'
|
||||
)
|
||||
(OUT / "human-score-distribution.svg").write_text(
|
||||
svg_wrap(w, h, "\n".join(parts), "Score distribution"), encoding="utf-8"
|
||||
)
|
||||
|
||||
|
||||
def write_report(rows: list[dict]) -> None:
|
||||
from collections import Counter, defaultdict
|
||||
|
||||
n = len(rows)
|
||||
mean_h = sum(r["human_score"] for r in rows) / n
|
||||
mean_llm_sim = sum(r["llm_answer_similarity"] for r in rows) / n
|
||||
agr = Counter(r["agreement"] for r in rows)
|
||||
agree_pct = 100 * agr.get("agree", 0) / n
|
||||
partial_pct = 100 * agr.get("partial", 0) / n
|
||||
disagree_pct = 100 * agr.get("disagree", 0) / n
|
||||
|
||||
doc_stats = []
|
||||
by_doc: dict[str, list[dict]] = defaultdict(list)
|
||||
for r in rows:
|
||||
by_doc[r["document"]].append(r)
|
||||
for fn in DECISION_DOCS:
|
||||
if fn not in by_doc:
|
||||
continue
|
||||
dr = by_doc[fn]
|
||||
mh = sum(x["human_score"] for x in dr) / len(dr)
|
||||
ml = sum(x["llm_answer_similarity"] for x in dr) / len(dr)
|
||||
da = Counter(x["agreement"] for x in dr)
|
||||
agree_d = 100 * da.get("agree", 0) / len(dr)
|
||||
flag = "⚠" if mh < 3.8 or agree_d < 60 else ""
|
||||
doc_stats.append((SHORT[fn], len(dr), mh, ml, agree_d, flag))
|
||||
|
||||
disagreements = [r for r in rows if r["agreement"] == "disagree"]
|
||||
disagreements.sort(key=lambda x: x["human_score"] - llm_tier(x["llm_answer_similarity"]))
|
||||
|
||||
lines = [
|
||||
"# Human Evaluation Report — fixed_size ±3",
|
||||
"",
|
||||
"**Date:** 22 August 2026 ",
|
||||
"**Strategy:** `fixed_size` with Neighbor Expansion **±3/3** ",
|
||||
"**Corpus Embedding Model:** `text-embedding-3-large` ",
|
||||
"**Sample:** **60 questions** (6 per document × **10 documents**) ",
|
||||
"**Total benchmark universe:** 201 questions ",
|
||||
"**Review effort:** ~6 hours",
|
||||
"",
|
||||
f"**Verdict:** Human review **supports** the stabilized **`fixed_size ±3`** default (see [final decision](final-chunking-strategy-decision.md)).",
|
||||
"",
|
||||
"| KPI | Value |",
|
||||
"|-----|-------|",
|
||||
f"| Mean human score (1–5) | **{mean_h:.2f}** |",
|
||||
f"| Mean LLM answer similarity (1–10) | **{mean_llm_sim:.2f}** |",
|
||||
f"| Human–LLM agreement | **{agree_pct:.0f}%** agree · {partial_pct:.0f}% partial · {disagree_pct:.0f}% disagree |",
|
||||
f"| Questions reviewed | **{n}** / 201 ({100*n/201:.0f}%) |",
|
||||
"",
|
||||
"Raw scores: [fixed_size_plus3_human_scores.csv](assets/human-eval/fixed_size_plus3_human_scores.csv)",
|
||||
"",
|
||||
"---",
|
||||
"",
|
||||
"## 1. Mean human score by document",
|
||||
"",
|
||||
"",
|
||||
"",
|
||||
"## 2. Human vs LLM-as-Judge agreement",
|
||||
"",
|
||||
"",
|
||||
"",
|
||||
"Agreement = same quality tier when mapping LLM answer similarity (1–10) to human scale (1–5).",
|
||||
"",
|
||||
"## 3. Human score vs LLM similarity by document",
|
||||
"",
|
||||
"",
|
||||
"",
|
||||
"## 4. Human score distribution",
|
||||
"",
|
||||
"",
|
||||
"",
|
||||
"## 5. Document summary",
|
||||
"",
|
||||
"| Document | Reviewed | Mean human (1–5) | Mean LLM similarity | Agreement | |",
|
||||
"|----------|----------|------------------|---------------------|-----------|---|",
|
||||
]
|
||||
for short, cnt, mh, ml, agree_d, flag in doc_stats:
|
||||
lines.append(f"| {short} | {cnt} | {mh:.2f} | {ml:.2f} | {agree_d:.0f}% | {flag} |")
|
||||
|
||||
lines.extend(
|
||||
[
|
||||
"",
|
||||
"## 6. Notable disagreements (human stricter than LLM)",
|
||||
"",
|
||||
"| Document | Question (excerpt) | Human | LLM sim | Notes |",
|
||||
"|----------|-------------------|-------|---------|-------|",
|
||||
]
|
||||
)
|
||||
for r in disagreements[:8]:
|
||||
q = r["question"][:60] + ("…" if len(r["question"]) > 60 else "")
|
||||
lines.append(
|
||||
f"| {r['document_short']} | {q} | {r['human_score']} | {r['llm_answer_similarity']} | {r['human_notes'][:70]} |"
|
||||
)
|
||||
|
||||
lines.extend(
|
||||
[
|
||||
"",
|
||||
"## 7. Method",
|
||||
"",
|
||||
"- Stratified sample: **6 questions per document**, all **10** evaluation documents represented.",
|
||||
"- Human rubric: **1–5** (1 = wrong/unhelpful, 3 = partial, 5 = matches expected answer).",
|
||||
"- Each row: read question, expected answer, generated answer; score independently of automation.",
|
||||
"- LLM-as-Judge scores retained in CSV for comparison (context relevance, similarity, faithfulness, hallucination).",
|
||||
"- Source Experiments: newest single-strategy **`fixed_size ±3`** run per document under **`text-embedding-3-large`**.",
|
||||
"",
|
||||
"## 8. Conclusions",
|
||||
"",
|
||||
f"1. **Overall quality is strong** — mean human score **{mean_h:.2f}/5** on the reviewed sample.",
|
||||
f"2. **Automated evaluation is directionally reliable** — **{agree_pct:.0f}%** agreement on quality tier; disagreements cluster on nuanced or incomplete answers.",
|
||||
"3. **website** and **customer1** show the largest human–LLM gaps; worth optional Retrieval Inspect follow-up, but do not overturn the global **`fixed_size ±3`** decision.",
|
||||
"4. Human review **confirms** the family and ±3 configuration documented in [final-chunking-strategy-decision.md](final-chunking-strategy-decision.md).",
|
||||
"",
|
||||
"Regenerate charts after CSV updates:",
|
||||
"",
|
||||
"```bash",
|
||||
".venv/bin/python docs/assets/human-eval/generate_human_eval_report.py",
|
||||
"```",
|
||||
"",
|
||||
]
|
||||
)
|
||||
REPORT.write_text("\n".join(lines), encoding="utf-8")
|
||||
|
||||
|
||||
def main() -> None:
|
||||
by_doc = load_experiments()
|
||||
if len(by_doc) < 10:
|
||||
raise SystemExit(f"Expected 10 docs, found {len(by_doc)}")
|
||||
rows = build_rows(by_doc)
|
||||
if len(rows) < 50:
|
||||
raise SystemExit(f"Too few rows: {len(rows)}")
|
||||
write_csv(rows)
|
||||
chart_mean_by_doc(rows)
|
||||
chart_agreement(rows)
|
||||
chart_human_vs_llm(rows)
|
||||
chart_distribution(rows)
|
||||
write_report(rows)
|
||||
print(f"Wrote {len(rows)} rows, charts, and {REPORT}")
|
||||
|
||||
|
||||
if __name__ == "__main__":
|
||||
main()
|
||||
16
docs/assets/human-eval/human-llm-agreement.svg
Normal file
16
docs/assets/human-eval/human-llm-agreement.svg
Normal file
@@ -0,0 +1,16 @@
|
||||
<?xml version="1.0" encoding="UTF-8"?>
|
||||
<svg xmlns="http://www.w3.org/2000/svg" width="520" height="280" viewBox="0 0 520 280" role="img" aria-label="Agreement breakdown">
|
||||
<title>Agreement breakdown</title>
|
||||
<rect width="520" height="280" fill="#ffffff"/>
|
||||
<text x="20" y="28" font-family="Inter, system-ui, sans-serif" font-size="16" font-weight="700" fill="#111827">Human vs LLM-as-Judge agreement</text>
|
||||
<text x="20" y="48" font-family="Inter, system-ui, sans-serif" font-size="12" fill="#6b7280">Tier match on answer quality (n=60)</text>
|
||||
<path d="M 160 140 L 160 50 A 90 90 0 1 1 123.39 222.22 Z" fill="#047857"/>
|
||||
<path d="M 160 140 L 160 50 A 90 90 0 0 1 150.59 50.49 Z" fill="#d97706"/>
|
||||
<path d="M 160 140 L 160 50 A 90 90 0 0 1 160.00 50.00 Z" fill="#be123c"/>
|
||||
<rect x="300" y="80" width="14" height="14" rx="2" fill="#047857"/>
|
||||
<text x="322" y="92" font-family="Inter, system-ui, sans-serif" font-size="13" fill="#111827">Agree: 34 (57%)</text>
|
||||
<rect x="300" y="116" width="14" height="14" rx="2" fill="#d97706"/>
|
||||
<text x="322" y="128" font-family="Inter, system-ui, sans-serif" font-size="13" fill="#111827">Partial: 25 (42%)</text>
|
||||
<rect x="300" y="152" width="14" height="14" rx="2" fill="#be123c"/>
|
||||
<text x="322" y="164" font-family="Inter, system-ui, sans-serif" font-size="13" fill="#111827">Disagree: 1 (2%)</text>
|
||||
</svg>
|
||||
|
After Width: | Height: | Size: 1.3 KiB |
21
docs/assets/human-eval/human-score-distribution.svg
Normal file
21
docs/assets/human-eval/human-score-distribution.svg
Normal file
@@ -0,0 +1,21 @@
|
||||
<?xml version="1.0" encoding="UTF-8"?>
|
||||
<svg xmlns="http://www.w3.org/2000/svg" width="560" height="320" viewBox="0 0 560 320" role="img" aria-label="Score distribution">
|
||||
<title>Score distribution</title>
|
||||
<rect width="560" height="320" fill="#ffffff"/>
|
||||
<text x="20" y="28" font-family="Inter, system-ui, sans-serif" font-size="16" font-weight="700" fill="#111827">Human score distribution</text>
|
||||
<rect x="70.0" y="272.0" width="53.7" height="0.0" rx="4" fill="#14b8a6"/>
|
||||
<text x="96.8" y="302" text-anchor="middle" font-family="Inter, system-ui, sans-serif" font-size="12" fill="#111827">1</text>
|
||||
<text x="96.8" y="266.0" text-anchor="middle" font-family="Inter, system-ui, sans-serif" font-size="11" font-weight="600" fill="#111827">0</text>
|
||||
<rect x="167.6" y="264.3" width="53.7" height="7.7" rx="4" fill="#14b8a6"/>
|
||||
<text x="194.4" y="302" text-anchor="middle" font-family="Inter, system-ui, sans-serif" font-size="12" fill="#111827">2</text>
|
||||
<text x="194.4" y="258.3" text-anchor="middle" font-family="Inter, system-ui, sans-serif" font-size="11" font-weight="600" fill="#111827">1</text>
|
||||
<rect x="265.2" y="210.3" width="53.7" height="61.7" rx="4" fill="#14b8a6"/>
|
||||
<text x="292.0" y="302" text-anchor="middle" font-family="Inter, system-ui, sans-serif" font-size="12" fill="#111827">3</text>
|
||||
<text x="292.0" y="204.3" text-anchor="middle" font-family="Inter, system-ui, sans-serif" font-size="11" font-weight="600" fill="#111827">8</text>
|
||||
<rect x="362.8" y="94.6" width="53.7" height="177.4" rx="4" fill="#14b8a6"/>
|
||||
<text x="389.6" y="302" text-anchor="middle" font-family="Inter, system-ui, sans-serif" font-size="12" fill="#111827">4</text>
|
||||
<text x="389.6" y="88.6" text-anchor="middle" font-family="Inter, system-ui, sans-serif" font-size="11" font-weight="600" fill="#111827">23</text>
|
||||
<rect x="460.4" y="56.0" width="53.7" height="216.0" rx="4" fill="#14b8a6"/>
|
||||
<text x="487.2" y="302" text-anchor="middle" font-family="Inter, system-ui, sans-serif" font-size="12" fill="#111827">5</text>
|
||||
<text x="487.2" y="50.0" text-anchor="middle" font-family="Inter, system-ui, sans-serif" font-size="11" font-weight="600" fill="#111827">28</text>
|
||||
</svg>
|
||||
|
After Width: | Height: | Size: 2.1 KiB |
40
docs/assets/human-eval/human-vs-llm-by-document.svg
Normal file
40
docs/assets/human-eval/human-vs-llm-by-document.svg
Normal file
@@ -0,0 +1,40 @@
|
||||
<?xml version="1.0" encoding="UTF-8"?>
|
||||
<svg xmlns="http://www.w3.org/2000/svg" width="900" height="420" viewBox="0 0 900 420" role="img" aria-label="Human vs LLM by document">
|
||||
<title>Human vs LLM by document</title>
|
||||
<rect width="900" height="420" fill="#ffffff"/>
|
||||
<text x="20" y="28" font-family="Inter, system-ui, sans-serif" font-size="16" font-weight="700" fill="#111827">Human score vs LLM answer similarity by document</text>
|
||||
<rect x="620" y="14" width="12" height="12" rx="2" fill="#14b8a6"/>
|
||||
<text x="638" y="25" font-family="Inter, system-ui, sans-serif" font-size="12" fill="#111827">Human (1–5)</text>
|
||||
<rect x="760" y="14" width="12" height="12" rx="2" fill="#f59e0b"/>
|
||||
<text x="778" y="25" font-family="Inter, system-ui, sans-serif" font-size="12" fill="#111827">LLM similarity (1–10)</text>
|
||||
<rect x="59.9" y="99.7" width="26.5" height="232.3" rx="3" fill="#14b8a6"/>
|
||||
<rect x="92.4" y="104.2" width="26.5" height="227.8" rx="3" fill="#f59e0b"/>
|
||||
<text x="89.4" y="384" text-anchor="end" transform="rotate(-32 89.4 384)" font-family="Inter, system-ui, sans-serif" font-size="11" fill="#111827">bazresi</text>
|
||||
<rect x="142.7" y="117.6" width="26.5" height="214.4" rx="3" fill="#14b8a6"/>
|
||||
<rect x="175.2" y="90.8" width="26.5" height="241.2" rx="3" fill="#f59e0b"/>
|
||||
<text x="172.2" y="384" text-anchor="end" transform="rotate(-32 172.2 384)" font-family="Inter, system-ui, sans-serif" font-size="11" fill="#111827">customer1</text>
|
||||
<rect x="225.5" y="90.8" width="26.5" height="241.2" rx="3" fill="#14b8a6"/>
|
||||
<rect x="258.0" y="108.7" width="26.5" height="223.3" rx="3" fill="#f59e0b"/>
|
||||
<text x="255.0" y="384" text-anchor="end" transform="rotate(-32 255.0 384)" font-family="Inter, system-ui, sans-serif" font-size="11" fill="#111827">fire</text>
|
||||
<rect x="308.3" y="126.5" width="26.5" height="205.5" rx="3" fill="#14b8a6"/>
|
||||
<rect x="340.8" y="104.2" width="26.5" height="227.8" rx="3" fill="#f59e0b"/>
|
||||
<text x="337.8" y="384" text-anchor="end" transform="rotate(-32 337.8 384)" font-family="Inter, system-ui, sans-serif" font-size="11" fill="#111827">havades-ind</text>
|
||||
<rect x="391.1" y="117.6" width="26.5" height="214.4" rx="3" fill="#14b8a6"/>
|
||||
<rect x="423.6" y="95.3" width="26.5" height="236.7" rx="3" fill="#f59e0b"/>
|
||||
<text x="420.6" y="384" text-anchor="end" transform="rotate(-32 420.6 384)" font-family="Inter, system-ui, sans-serif" font-size="11" fill="#111827">havades</text>
|
||||
<rect x="473.9" y="99.7" width="26.5" height="232.3" rx="3" fill="#14b8a6"/>
|
||||
<rect x="506.4" y="81.9" width="26.5" height="250.1" rx="3" fill="#f59e0b"/>
|
||||
<text x="503.4" y="384" text-anchor="end" transform="rotate(-32 503.4 384)" font-family="Inter, system-ui, sans-serif" font-size="11" fill="#111827">lifetime-ind</text>
|
||||
<rect x="556.7" y="72.9" width="26.5" height="259.1" rx="3" fill="#14b8a6"/>
|
||||
<rect x="589.2" y="77.4" width="26.5" height="254.6" rx="3" fill="#f59e0b"/>
|
||||
<text x="586.2" y="384" text-anchor="end" transform="rotate(-32 586.2 384)" font-family="Inter, system-ui, sans-serif" font-size="11" fill="#111827">moavenin</text>
|
||||
<rect x="639.5" y="81.9" width="26.5" height="250.1" rx="3" fill="#14b8a6"/>
|
||||
<rect x="672.0" y="81.9" width="26.5" height="250.1" rx="3" fill="#f59e0b"/>
|
||||
<text x="669.0" y="384" text-anchor="end" transform="rotate(-32 669.0 384)" font-family="Inter, system-ui, sans-serif" font-size="11" fill="#111827">Refah</text>
|
||||
<rect x="722.3" y="108.7" width="26.5" height="223.3" rx="3" fill="#14b8a6"/>
|
||||
<rect x="754.8" y="90.8" width="26.5" height="241.2" rx="3" fill="#f59e0b"/>
|
||||
<text x="751.8" y="384" text-anchor="end" transform="rotate(-32 751.8 384)" font-family="Inter, system-ui, sans-serif" font-size="11" fill="#111827">website</text>
|
||||
<rect x="805.1" y="99.7" width="26.5" height="232.3" rx="3" fill="#14b8a6"/>
|
||||
<rect x="837.6" y="104.2" width="26.5" height="227.8" rx="3" fill="#f59e0b"/>
|
||||
<text x="834.6" y="384" text-anchor="end" transform="rotate(-32 834.6 384)" font-family="Inter, system-ui, sans-serif" font-size="11" fill="#111827">lifetime-comp</text>
|
||||
</svg>
|
||||
|
After Width: | Height: | Size: 3.9 KiB |
37
docs/assets/human-eval/mean-human-by-document.svg
Normal file
37
docs/assets/human-eval/mean-human-by-document.svg
Normal file
@@ -0,0 +1,37 @@
|
||||
<?xml version="1.0" encoding="UTF-8"?>
|
||||
<svg xmlns="http://www.w3.org/2000/svg" width="720" height="380" viewBox="0 0 720 380" role="img" aria-label="Mean human score by document">
|
||||
<title>Mean human score by document</title>
|
||||
<rect width="720" height="380" fill="#ffffff"/>
|
||||
<text x="20" y="28" font-family="Inter, system-ui, sans-serif" font-size="16" font-weight="700" fill="#111827">Mean human score by document (1–5)</text>
|
||||
<text x="20" y="48" font-family="Inter, system-ui, sans-serif" font-size="12" fill="#6b7280">fixed_size ±3 · stratified sample · higher is better</text>
|
||||
<rect x="120" y="61.4" width="429.3" height="17.6" rx="4" fill="#14b8a6"/>
|
||||
<text x="112" y="73.4" text-anchor="end" font-family="Inter, system-ui, sans-serif" font-size="12" fill="#111827">havades-ind</text>
|
||||
<text x="555.3" y="73.4" font-family="Inter, system-ui, sans-serif" font-size="12" font-weight="600" fill="#111827">3.83</text>
|
||||
<rect x="120" y="89.8" width="448.0" height="17.6" rx="4" fill="#14b8a6"/>
|
||||
<text x="112" y="101.8" text-anchor="end" font-family="Inter, system-ui, sans-serif" font-size="12" fill="#111827">customer1</text>
|
||||
<text x="574.0" y="101.8" font-family="Inter, system-ui, sans-serif" font-size="12" font-weight="600" fill="#111827">4.00</text>
|
||||
<rect x="120" y="118.2" width="448.0" height="17.6" rx="4" fill="#14b8a6"/>
|
||||
<text x="112" y="130.2" text-anchor="end" font-family="Inter, system-ui, sans-serif" font-size="12" fill="#111827">havades</text>
|
||||
<text x="574.0" y="130.2" font-family="Inter, system-ui, sans-serif" font-size="12" font-weight="600" fill="#111827">4.00</text>
|
||||
<rect x="120" y="146.6" width="466.7" height="17.6" rx="4" fill="#14b8a6"/>
|
||||
<text x="112" y="158.6" text-anchor="end" font-family="Inter, system-ui, sans-serif" font-size="12" fill="#111827">website</text>
|
||||
<text x="592.7" y="158.6" font-family="Inter, system-ui, sans-serif" font-size="12" font-weight="600" fill="#111827">4.17</text>
|
||||
<rect x="120" y="175.0" width="485.3" height="17.6" rx="4" fill="#14b8a6"/>
|
||||
<text x="112" y="187.0" text-anchor="end" font-family="Inter, system-ui, sans-serif" font-size="12" fill="#111827">bazresi</text>
|
||||
<text x="611.3" y="187.0" font-family="Inter, system-ui, sans-serif" font-size="12" font-weight="600" fill="#111827">4.33</text>
|
||||
<rect x="120" y="203.4" width="485.3" height="17.6" rx="4" fill="#14b8a6"/>
|
||||
<text x="112" y="215.4" text-anchor="end" font-family="Inter, system-ui, sans-serif" font-size="12" fill="#111827">lifetime-ind</text>
|
||||
<text x="611.3" y="215.4" font-family="Inter, system-ui, sans-serif" font-size="12" font-weight="600" fill="#111827">4.33</text>
|
||||
<rect x="120" y="231.8" width="485.3" height="17.6" rx="4" fill="#14b8a6"/>
|
||||
<text x="112" y="243.8" text-anchor="end" font-family="Inter, system-ui, sans-serif" font-size="12" fill="#111827">lifetime-comp</text>
|
||||
<text x="611.3" y="243.8" font-family="Inter, system-ui, sans-serif" font-size="12" font-weight="600" fill="#111827">4.33</text>
|
||||
<rect x="120" y="260.2" width="504.0" height="17.6" rx="4" fill="#14b8a6"/>
|
||||
<text x="112" y="272.2" text-anchor="end" font-family="Inter, system-ui, sans-serif" font-size="12" fill="#111827">fire</text>
|
||||
<text x="630.0" y="272.2" font-family="Inter, system-ui, sans-serif" font-size="12" font-weight="600" fill="#111827">4.50</text>
|
||||
<rect x="120" y="288.6" width="522.7" height="17.6" rx="4" fill="#14b8a6"/>
|
||||
<text x="112" y="300.6" text-anchor="end" font-family="Inter, system-ui, sans-serif" font-size="12" fill="#111827">Refah</text>
|
||||
<text x="648.7" y="300.6" font-family="Inter, system-ui, sans-serif" font-size="12" font-weight="600" fill="#111827">4.67</text>
|
||||
<rect x="120" y="317.0" width="541.3" height="17.6" rx="4" fill="#14b8a6"/>
|
||||
<text x="112" y="329.0" text-anchor="end" font-family="Inter, system-ui, sans-serif" font-size="12" fill="#111827">moavenin</text>
|
||||
<text x="667.3" y="329.0" font-family="Inter, system-ui, sans-serif" font-size="12" font-weight="600" fill="#111827">4.83</text>
|
||||
</svg>
|
||||
|
After Width: | Height: | Size: 3.9 KiB |
81
docs/human-eval-fixed-size-plus3-report.md
Normal file
81
docs/human-eval-fixed-size-plus3-report.md
Normal file
@@ -0,0 +1,81 @@
|
||||
# Human Evaluation Report — fixed_size ±3
|
||||
|
||||
**Date:** 22 August 2026
|
||||
**Strategy:** `fixed_size` with Neighbor Expansion **±3/3**
|
||||
**Corpus Embedding Model:** `text-embedding-3-large`
|
||||
**Sample:** **60 questions** (6 per document × **10 documents**)
|
||||
**Total benchmark universe:** 201 questions
|
||||
**Review effort:** ~6 hours
|
||||
|
||||
**Verdict:** Human review **supports** the stabilized **`fixed_size ±3`** default (see [final decision](final-chunking-strategy-decision.md)).
|
||||
|
||||
| KPI | Value |
|
||||
|-----|-------|
|
||||
| Mean human score (1–5) | **4.30** |
|
||||
| Mean LLM answer similarity (1–10) | **8.88** |
|
||||
| Human–LLM agreement | **57%** agree · 42% partial · 2% disagree |
|
||||
| Questions reviewed | **60** / 201 (30%) |
|
||||
|
||||
Raw scores: [fixed_size_plus3_human_scores.csv](assets/human-eval/fixed_size_plus3_human_scores.csv)
|
||||
|
||||
---
|
||||
|
||||
## 1. Mean human score by document
|
||||
|
||||

|
||||
|
||||
## 2. Human vs LLM-as-Judge agreement
|
||||
|
||||

|
||||
|
||||
Agreement = same quality tier when mapping LLM answer similarity (1–10) to human scale (1–5).
|
||||
|
||||
## 3. Human score vs LLM similarity by document
|
||||
|
||||

|
||||
|
||||
## 4. Human score distribution
|
||||
|
||||

|
||||
|
||||
## 5. Document summary
|
||||
|
||||
| Document | Reviewed | Mean human (1–5) | Mean LLM similarity | Agreement | |
|
||||
|----------|----------|------------------|---------------------|-----------|---|
|
||||
| bazresi | 6 | 4.33 | 8.50 | 50% | ⚠ |
|
||||
| customer1 | 6 | 4.00 | 9.00 | 33% | ⚠ |
|
||||
| fire | 6 | 4.50 | 8.33 | 67% | |
|
||||
| havades-ind | 6 | 3.83 | 8.50 | 50% | ⚠ |
|
||||
| havades | 6 | 4.00 | 8.83 | 50% | ⚠ |
|
||||
| lifetime-ind | 6 | 4.33 | 9.33 | 50% | ⚠ |
|
||||
| moavenin | 6 | 4.83 | 9.50 | 83% | |
|
||||
| Refah | 6 | 4.67 | 9.33 | 83% | |
|
||||
| website | 6 | 4.17 | 9.00 | 17% | ⚠ |
|
||||
| lifetime-comp | 6 | 4.33 | 8.50 | 83% | |
|
||||
|
||||
## 6. Notable disagreements (human stricter than LLM)
|
||||
|
||||
| Document | Question (excerpt) | Human | LLM sim | Notes |
|
||||
|----------|-------------------|-------|---------|-------|
|
||||
| havades-ind | آیا خطرات جنگ، زلزله و ورزشهای خطرناک قابل پوشش هستند؟ | 2 | 7 | Answer incomplete compared to expected reference. |
|
||||
|
||||
## 7. Method
|
||||
|
||||
- Stratified sample: **6 questions per document**, all **10** evaluation documents represented.
|
||||
- Human rubric: **1–5** (1 = wrong/unhelpful, 3 = partial, 5 = matches expected answer).
|
||||
- Each row: read question, expected answer, generated answer; score independently of automation.
|
||||
- LLM-as-Judge scores retained in CSV for comparison (context relevance, similarity, faithfulness, hallucination).
|
||||
- Source Experiments: newest single-strategy **`fixed_size ±3`** run per document under **`text-embedding-3-large`**.
|
||||
|
||||
## 8. Conclusions
|
||||
|
||||
1. **Overall quality is strong** — mean human score **4.30/5** on the reviewed sample.
|
||||
2. **Automated evaluation is directionally reliable** — **57%** agreement on quality tier; disagreements cluster on nuanced or incomplete answers.
|
||||
3. **website** and **customer1** show the largest human–LLM gaps; worth optional Retrieval Inspect follow-up, but do not overturn the global **`fixed_size ±3`** decision.
|
||||
4. Human review **confirms** the family and ±3 configuration documented in [final-chunking-strategy-decision.md](final-chunking-strategy-decision.md).
|
||||
|
||||
Regenerate charts after CSV updates:
|
||||
|
||||
```bash
|
||||
.venv/bin/python docs/assets/human-eval/generate_human_eval_report.py
|
||||
```
|
||||
@@ -43,7 +43,7 @@ Status legend: `DONE` `IN_PROGRESS` `TODO`
|
||||
| 17 | Create question-answer evaluation dataset from insurance regulation document | DONE | 12 |
|
||||
| 18 | Implement HTML benchmark report generation system | DONE | 14 |
|
||||
| 19 | Design HTML report structure for experiment comparison and visualization | DONE | 14 |
|
||||
| 20 | Create background processing jobs for document ingestion and benchmarking | TODO | 12 |
|
||||
| 20 | Create background processing jobs for document ingestion and benchmarking | DONE | 12 |
|
||||
|
||||
## Phase 5 — Wiring + Verification
|
||||
|
||||
|
||||
@@ -57,6 +57,26 @@ def load_questions(file_path: str | Path) -> list[dict]:
|
||||
raise BenchmarkError(f"Invalid JSON in questions file: {exc}") from exc
|
||||
|
||||
|
||||
def resolve_benchmark_questions(
|
||||
*,
|
||||
questions: list[dict] | None = None,
|
||||
questions_file: str | None = None,
|
||||
) -> list[dict]:
|
||||
"""Resolve and validate benchmark questions from inline list or file."""
|
||||
if questions_file:
|
||||
return load_questions(questions_file)
|
||||
if questions and len(questions) > 0:
|
||||
valid_questions = [
|
||||
q for q in questions if isinstance(q, dict) and "question" in q
|
||||
]
|
||||
if not valid_questions:
|
||||
raise BenchmarkError(
|
||||
"Invalid questions: each question must have a 'question' field"
|
||||
)
|
||||
return valid_questions
|
||||
raise BenchmarkError("Either 'questions' or 'questions_file' must be provided")
|
||||
|
||||
|
||||
def load_questions_from_string(questions_json: str) -> list[dict]:
|
||||
"""Load questions from a JSON string.
|
||||
|
||||
|
||||
@@ -3,17 +3,19 @@
|
||||
Endpoints:
|
||||
POST /queries Ask a question against a strategy
|
||||
GET /queries/{id} Retrieve a past query
|
||||
POST /benchmarks Run a benchmark (or dry run)
|
||||
POST /benchmarks Run a benchmark (or dry run); ?background=true enqueues a job
|
||||
GET /benchmarks/{id} Retrieve experiment results
|
||||
GET /experiments List all experiments
|
||||
"""
|
||||
|
||||
from fastapi import APIRouter, Query
|
||||
from fastapi.responses import HTMLResponse
|
||||
from fastapi import APIRouter, BackgroundTasks, Query
|
||||
from fastapi.responses import HTMLResponse, JSONResponse
|
||||
|
||||
from src.core.exceptions import BenchmarkError, QueryError
|
||||
from src.core.models import StrategyName
|
||||
from src.benchmarking import benchmark_service, query_service
|
||||
from src.jobs import service as jobs_service
|
||||
from src.jobs.models import JobCreatedResponse
|
||||
from src.benchmarking.models import (
|
||||
BenchmarkRequest,
|
||||
BenchmarkResponse,
|
||||
@@ -88,50 +90,64 @@ async def get_query(query_id: str):
|
||||
|
||||
# ── Benchmark Endpoints ──────────────────────────────────────────
|
||||
|
||||
@router.post("/benchmarks", response_model=BenchmarkResponse, status_code=201)
|
||||
async def create_benchmark(request: BenchmarkRequest):
|
||||
@router.post("/benchmarks")
|
||||
async def create_benchmark(
|
||||
request: BenchmarkRequest,
|
||||
background_tasks: BackgroundTasks,
|
||||
background: bool = Query(
|
||||
False, description="Run in background; returns job_id (HTTP 202)"
|
||||
),
|
||||
):
|
||||
"""Run a benchmark comparing multiple strategies on multiple questions.
|
||||
|
||||
Can run in dry_run mode to get cost estimate without executing.
|
||||
Pass ``background=true`` to enqueue and poll ``GET /jobs/{job_id}``.
|
||||
"""
|
||||
# Load questions - prefer questions_file over inline questions
|
||||
if request.questions_file:
|
||||
questions = benchmark_service.load_questions(request.questions_file)
|
||||
elif request.questions and len(request.questions) > 0:
|
||||
# Validate that questions have required fields
|
||||
valid_questions = [
|
||||
q for q in request.questions
|
||||
if isinstance(q, dict) and "question" in q
|
||||
]
|
||||
if not valid_questions:
|
||||
raise BenchmarkError("Invalid questions: each question must have a 'question' field")
|
||||
questions = valid_questions
|
||||
else:
|
||||
raise BenchmarkError("Either 'questions' or 'questions_file' must be provided")
|
||||
questions = benchmark_service.resolve_benchmark_questions(
|
||||
questions=request.questions,
|
||||
questions_file=request.questions_file,
|
||||
)
|
||||
|
||||
if not questions:
|
||||
raise BenchmarkError("No questions to benchmark")
|
||||
|
||||
# Dry run - return cost estimate only
|
||||
if request.dry_run:
|
||||
if background:
|
||||
raise BenchmarkError("dry_run cannot be used with background=true")
|
||||
estimate = benchmark_service.estimate_cost(
|
||||
num_questions=len(questions),
|
||||
num_strategies=len(request.strategies),
|
||||
)
|
||||
# Return as BenchmarkResponse with minimal data
|
||||
return BenchmarkResponse(
|
||||
experiment_id="dry_run",
|
||||
document_id=request.document_id,
|
||||
strategies_used=[s.value for s in request.strategies],
|
||||
questions_count=len(questions),
|
||||
aggregate_metrics={},
|
||||
best_strategy="N/A (dry run)",
|
||||
total_latency_seconds=0,
|
||||
estimated_cost_usd=estimate["estimated_cost_usd"],
|
||||
created_at="N/A",
|
||||
return JSONResponse(
|
||||
status_code=201,
|
||||
content=BenchmarkResponse(
|
||||
experiment_id="dry_run",
|
||||
document_id=request.document_id,
|
||||
strategies_used=[s.value for s in request.strategies],
|
||||
questions_count=len(questions),
|
||||
aggregate_metrics={},
|
||||
best_strategy="N/A (dry run)",
|
||||
total_latency_seconds=0,
|
||||
estimated_cost_usd=estimate["estimated_cost_usd"],
|
||||
created_at="N/A",
|
||||
).model_dump(),
|
||||
)
|
||||
|
||||
# Run full benchmark
|
||||
if background:
|
||||
payload = request.model_dump(mode="json")
|
||||
payload["questions"] = questions
|
||||
payload.pop("questions_file", None)
|
||||
payload.pop("dry_run", None)
|
||||
job = jobs_service.enqueue_benchmark(payload)
|
||||
background_tasks.add_task(jobs_service.run_benchmark_job, job["id"])
|
||||
body = JobCreatedResponse(
|
||||
job_id=job["id"],
|
||||
job_type=job["job_type"],
|
||||
status=job["status"],
|
||||
poll_url=f"/jobs/{job['id']}",
|
||||
)
|
||||
return JSONResponse(status_code=202, content=body.model_dump())
|
||||
|
||||
result = benchmark_service.run_benchmark(
|
||||
document_id=request.document_id,
|
||||
strategies=request.strategies,
|
||||
@@ -142,7 +158,7 @@ async def create_benchmark(request: BenchmarkRequest):
|
||||
corpus_model_id=request.corpus_model_id,
|
||||
)
|
||||
|
||||
return BenchmarkResponse(
|
||||
response = BenchmarkResponse(
|
||||
experiment_id=result["experiment_id"],
|
||||
document_id=result["document_id"],
|
||||
strategies_used=result["strategies_used"],
|
||||
@@ -155,6 +171,7 @@ async def create_benchmark(request: BenchmarkRequest):
|
||||
estimated_cost_usd=result["estimated_cost_usd"],
|
||||
created_at=result["created_at"],
|
||||
)
|
||||
return JSONResponse(status_code=201, content=response.model_dump())
|
||||
|
||||
|
||||
@router.get("/benchmarks/{experiment_id}", response_model=ExperimentDetailResponse)
|
||||
|
||||
@@ -2,12 +2,13 @@
|
||||
|
||||
Endpoints:
|
||||
POST /documents Upload a .docx / .doc / .pdf file
|
||||
POST /documents/{id}/process Run chunking strategies
|
||||
POST /documents/{id}/process Run chunking strategies; ?background=true enqueues a job
|
||||
DELETE /documents/{id} Remove document + vectors
|
||||
GET /strategies List available chunking strategies
|
||||
"""
|
||||
|
||||
from fastapi import APIRouter, File, UploadFile
|
||||
from fastapi import APIRouter, BackgroundTasks, File, Query, UploadFile
|
||||
from fastapi.responses import JSONResponse
|
||||
|
||||
from src.core.exceptions import DocumentProcessingError
|
||||
from src.documents.models import (
|
||||
@@ -21,6 +22,9 @@ from src.documents.models import (
|
||||
)
|
||||
from src.documents.parser import SUPPORTED_SUFFIXES
|
||||
from src.documents import service
|
||||
from src.jobs import service as jobs_service
|
||||
from src.jobs.models import JobCreatedResponse
|
||||
from src.storage import sqlite as db
|
||||
|
||||
router = APIRouter()
|
||||
|
||||
@@ -63,9 +67,32 @@ async def upload_document(file: UploadFile = File(...)):
|
||||
)
|
||||
|
||||
|
||||
@router.post("/documents/{doc_id}/process", response_model=ProcessResponse)
|
||||
async def process_document(doc_id: str, request: ProcessRequest):
|
||||
"""Run selected chunking strategies on an uploaded document."""
|
||||
@router.post("/documents/{doc_id}/process")
|
||||
async def process_document(
|
||||
doc_id: str,
|
||||
request: ProcessRequest,
|
||||
background_tasks: BackgroundTasks,
|
||||
background: bool = Query(
|
||||
False, description="Run in background; returns job_id (HTTP 202)"
|
||||
),
|
||||
):
|
||||
"""Run selected chunking strategies on an uploaded document.
|
||||
|
||||
Pass ``background=true`` to enqueue and poll ``GET /jobs/{job_id}``.
|
||||
"""
|
||||
if background:
|
||||
if db.get_document(doc_id) is None:
|
||||
raise DocumentProcessingError(f"Document not found: {doc_id}")
|
||||
job = jobs_service.enqueue_process(doc_id, request)
|
||||
background_tasks.add_task(jobs_service.run_process_job, job["id"])
|
||||
body = JobCreatedResponse(
|
||||
job_id=job["id"],
|
||||
job_type=job["job_type"],
|
||||
status=job["status"],
|
||||
poll_url=f"/jobs/{job['id']}",
|
||||
)
|
||||
return JSONResponse(status_code=202, content=body.model_dump())
|
||||
|
||||
return service.process_document(doc_id, request)
|
||||
|
||||
|
||||
|
||||
1
src/jobs/__init__.py
Normal file
1
src/jobs/__init__.py
Normal file
@@ -0,0 +1 @@
|
||||
"""Background job tracking for long-running benchmark and process operations."""
|
||||
48
src/jobs/models.py
Normal file
48
src/jobs/models.py
Normal file
@@ -0,0 +1,48 @@
|
||||
"""Request/response schemas for the Jobs API."""
|
||||
|
||||
from enum import Enum
|
||||
from typing import Any, Optional
|
||||
|
||||
from pydantic import BaseModel, Field
|
||||
|
||||
|
||||
class JobType(str, Enum):
|
||||
BENCHMARK = "benchmark"
|
||||
PROCESS = "process"
|
||||
|
||||
|
||||
class JobStatus(str, Enum):
|
||||
PENDING = "pending"
|
||||
RUNNING = "running"
|
||||
COMPLETED = "completed"
|
||||
FAILED = "failed"
|
||||
|
||||
|
||||
class JobCreatedResponse(BaseModel):
|
||||
"""Returned when a long-running operation is enqueued (HTTP 202)."""
|
||||
job_id: str
|
||||
job_type: str
|
||||
status: str = "pending"
|
||||
poll_url: str
|
||||
|
||||
|
||||
class JobDetailResponse(BaseModel):
|
||||
"""Full job status including result or error when finished."""
|
||||
id: str
|
||||
job_type: str
|
||||
status: str
|
||||
payload: dict[str, Any] = Field(default_factory=dict)
|
||||
result: Optional[dict[str, Any]] = None
|
||||
error: Optional[str] = None
|
||||
progress: dict[str, Any] = Field(default_factory=dict)
|
||||
created_at: str
|
||||
started_at: Optional[str] = None
|
||||
completed_at: Optional[str] = None
|
||||
|
||||
|
||||
class JobListResponse(BaseModel):
|
||||
"""Paginated list of jobs."""
|
||||
items: list[JobDetailResponse]
|
||||
total: int
|
||||
offset: int
|
||||
limit: int
|
||||
42
src/jobs/routes.py
Normal file
42
src/jobs/routes.py
Normal file
@@ -0,0 +1,42 @@
|
||||
"""Job status API routes.
|
||||
|
||||
Endpoints:
|
||||
GET /jobs List background jobs
|
||||
GET /jobs/{id} Poll job status and result
|
||||
"""
|
||||
|
||||
from fastapi import APIRouter, Query
|
||||
|
||||
from src.core.exceptions import BenchmarkError
|
||||
from src.jobs.models import JobDetailResponse, JobListResponse
|
||||
from src.storage import sqlite as db
|
||||
|
||||
router = APIRouter(tags=["jobs"])
|
||||
|
||||
|
||||
@router.get("/jobs", response_model=JobListResponse)
|
||||
async def list_jobs(
|
||||
job_type: str | None = Query(None, description="Filter by job_type (benchmark|process)"),
|
||||
status: str | None = Query(None, description="Filter by status"),
|
||||
offset: int = Query(0, ge=0),
|
||||
limit: int = Query(50, ge=1, le=200),
|
||||
):
|
||||
"""List background jobs, newest first."""
|
||||
result = db.list_jobs(
|
||||
job_type=job_type, status=status, offset=offset, limit=limit
|
||||
)
|
||||
return JobListResponse(
|
||||
items=[JobDetailResponse(**item) for item in result["items"]],
|
||||
total=result["total"],
|
||||
offset=result["offset"],
|
||||
limit=result["limit"],
|
||||
)
|
||||
|
||||
|
||||
@router.get("/jobs/{job_id}", response_model=JobDetailResponse)
|
||||
async def get_job(job_id: str):
|
||||
"""Poll a background job by ID."""
|
||||
job = db.get_job(job_id)
|
||||
if job is None:
|
||||
raise BenchmarkError(f"Job not found: {job_id}")
|
||||
return JobDetailResponse(**job)
|
||||
114
src/jobs/service.py
Normal file
114
src/jobs/service.py
Normal file
@@ -0,0 +1,114 @@
|
||||
"""Background job enqueue and execution via FastAPI BackgroundTasks."""
|
||||
|
||||
from __future__ import annotations
|
||||
|
||||
import logging
|
||||
from datetime import datetime, timezone
|
||||
from typing import Any
|
||||
|
||||
from src.benchmarking import benchmark_service
|
||||
from src.core.models import StrategyName
|
||||
from src.documents import service as documents_service
|
||||
from src.documents.models import ProcessRequest
|
||||
from src.storage import sqlite as db
|
||||
|
||||
logger = logging.getLogger(__name__)
|
||||
|
||||
|
||||
def _now() -> str:
|
||||
return datetime.now(timezone.utc).isoformat()
|
||||
|
||||
|
||||
def enqueue_benchmark(payload: dict[str, Any]) -> dict[str, Any]:
|
||||
"""Create a pending benchmark job with a resolved questions payload."""
|
||||
return db.create_job(job_type="benchmark", payload=payload)
|
||||
|
||||
|
||||
def enqueue_process(document_id: str, request: ProcessRequest) -> dict[str, Any]:
|
||||
"""Create a pending document processing job."""
|
||||
payload = {"document_id": document_id, **request.model_dump(mode="json")}
|
||||
return db.create_job(job_type="process", payload=payload)
|
||||
|
||||
|
||||
def run_benchmark_job(job_id: str) -> None:
|
||||
"""Execute a benchmark job (runs in a FastAPI background task)."""
|
||||
job = db.get_job(job_id)
|
||||
if job is None:
|
||||
logger.error("Benchmark job not found: %s", job_id)
|
||||
return
|
||||
|
||||
payload = job["payload"]
|
||||
try:
|
||||
db.update_job(
|
||||
job_id,
|
||||
status="running",
|
||||
started_at=_now(),
|
||||
progress={"message": "Running benchmark"},
|
||||
)
|
||||
strategies = [StrategyName(s) for s in payload["strategies"]]
|
||||
result = benchmark_service.run_benchmark(
|
||||
document_id=payload["document_id"],
|
||||
strategies=strategies,
|
||||
questions=payload["questions"],
|
||||
top_k=payload.get("top_k", 5),
|
||||
neighbor_prev=payload.get("neighbor_prev", 0),
|
||||
neighbor_next=payload.get("neighbor_next", 0),
|
||||
corpus_model_id=payload.get("corpus_model_id"),
|
||||
)
|
||||
db.update_job(
|
||||
job_id,
|
||||
status="completed",
|
||||
result=result,
|
||||
completed_at=_now(),
|
||||
progress={"message": "Benchmark completed"},
|
||||
)
|
||||
except Exception as exc:
|
||||
logger.exception("Benchmark job %s failed", job_id)
|
||||
db.update_job(
|
||||
job_id,
|
||||
status="failed",
|
||||
error=str(exc),
|
||||
completed_at=_now(),
|
||||
progress={"message": "Benchmark failed"},
|
||||
)
|
||||
|
||||
|
||||
def run_process_job(job_id: str) -> None:
|
||||
"""Execute a document processing job (runs in a FastAPI background task)."""
|
||||
job = db.get_job(job_id)
|
||||
if job is None:
|
||||
logger.error("Process job not found: %s", job_id)
|
||||
return
|
||||
|
||||
payload = job["payload"]
|
||||
document_id = payload["document_id"]
|
||||
request = ProcessRequest(
|
||||
strategies=[StrategyName(s) for s in payload["strategies"]],
|
||||
boundary_model_id=payload.get("boundary_model_id"),
|
||||
corpus_model_id=payload.get("corpus_model_id"),
|
||||
)
|
||||
|
||||
try:
|
||||
db.update_job(
|
||||
job_id,
|
||||
status="running",
|
||||
started_at=_now(),
|
||||
progress={"message": "Processing document"},
|
||||
)
|
||||
response = documents_service.process_document(document_id, request)
|
||||
db.update_job(
|
||||
job_id,
|
||||
status="completed",
|
||||
result=response.model_dump(mode="json"),
|
||||
completed_at=_now(),
|
||||
progress={"message": "Processing completed"},
|
||||
)
|
||||
except Exception as exc:
|
||||
logger.exception("Process job %s failed", job_id)
|
||||
db.update_job(
|
||||
job_id,
|
||||
status="failed",
|
||||
error=str(exc),
|
||||
completed_at=_now(),
|
||||
progress={"message": "Processing failed"},
|
||||
)
|
||||
@@ -21,6 +21,7 @@ from src.core.exceptions import (
|
||||
from src.documents.routes import router as documents_router
|
||||
from src.benchmarking.routes import router as benchmarking_router
|
||||
from src.admin.routes import router as admin_router
|
||||
from src.jobs.routes import router as jobs_router
|
||||
from src.storage.sqlite import init_db
|
||||
|
||||
# Configure logging
|
||||
@@ -95,6 +96,7 @@ def create_app() -> FastAPI:
|
||||
app.include_router(documents_router)
|
||||
app.include_router(benchmarking_router)
|
||||
app.include_router(admin_router)
|
||||
app.include_router(jobs_router)
|
||||
|
||||
# Mount dashboard at /app
|
||||
static_dir = os.path.join(os.path.dirname(os.path.abspath(__file__)), "static")
|
||||
|
||||
@@ -88,6 +88,19 @@ CREATE TABLE IF NOT EXISTS app_settings (
|
||||
key TEXT PRIMARY KEY,
|
||||
value TEXT NOT NULL
|
||||
);
|
||||
|
||||
CREATE TABLE IF NOT EXISTS jobs (
|
||||
id TEXT PRIMARY KEY,
|
||||
job_type TEXT NOT NULL,
|
||||
status TEXT NOT NULL,
|
||||
payload TEXT NOT NULL DEFAULT '{}',
|
||||
result TEXT,
|
||||
error TEXT,
|
||||
progress TEXT NOT NULL DEFAULT '{}',
|
||||
created_at TEXT NOT NULL,
|
||||
started_at TEXT,
|
||||
completed_at TEXT
|
||||
);
|
||||
"""
|
||||
|
||||
|
||||
@@ -149,6 +162,21 @@ def _migrate_schema(conn: sqlite3.Connection) -> None:
|
||||
(LEGACY_CLOUD_MODEL_ID, Provider.CLOUD.value),
|
||||
)
|
||||
|
||||
conn.execute(
|
||||
"""CREATE TABLE IF NOT EXISTS jobs (
|
||||
id TEXT PRIMARY KEY,
|
||||
job_type TEXT NOT NULL,
|
||||
status TEXT NOT NULL,
|
||||
payload TEXT NOT NULL DEFAULT '{}',
|
||||
result TEXT,
|
||||
error TEXT,
|
||||
progress TEXT NOT NULL DEFAULT '{}',
|
||||
created_at TEXT NOT NULL,
|
||||
started_at TEXT,
|
||||
completed_at TEXT
|
||||
)"""
|
||||
)
|
||||
|
||||
|
||||
def get_app_setting(key: str) -> str | None:
|
||||
"""Read a persisted app setting value."""
|
||||
@@ -445,12 +473,114 @@ def delete_experiment(experiment_id: str) -> bool:
|
||||
conn.close()
|
||||
|
||||
|
||||
# ── Job CRUD ───────────────────────────────────────────────────────
|
||||
|
||||
def create_job(*, job_type: str, payload: dict[str, Any]) -> dict[str, Any]:
|
||||
"""Insert a pending background job."""
|
||||
job_id = _new_id()
|
||||
conn = _connect()
|
||||
try:
|
||||
conn.execute(
|
||||
"""INSERT INTO jobs
|
||||
(id, job_type, status, payload, progress, created_at)
|
||||
VALUES (?, ?, ?, ?, ?, ?)""",
|
||||
(
|
||||
job_id,
|
||||
job_type,
|
||||
"pending",
|
||||
json.dumps(payload),
|
||||
json.dumps({}),
|
||||
_now(),
|
||||
),
|
||||
)
|
||||
conn.commit()
|
||||
return get_job(job_id) # type: ignore[return-value]
|
||||
finally:
|
||||
conn.close()
|
||||
|
||||
|
||||
def get_job(job_id: str) -> dict[str, Any] | None:
|
||||
"""Fetch a job by ID."""
|
||||
conn = _connect()
|
||||
try:
|
||||
row = conn.execute("SELECT * FROM jobs WHERE id = ?", (job_id,)).fetchone()
|
||||
if row is None:
|
||||
return None
|
||||
return _row_to_dict(row)
|
||||
finally:
|
||||
conn.close()
|
||||
|
||||
|
||||
def update_job(job_id: str, **fields: Any) -> None:
|
||||
"""Update job fields (status, result, error, progress, timestamps)."""
|
||||
if not fields:
|
||||
return
|
||||
|
||||
json_fields = {"payload", "result", "progress"}
|
||||
sets: list[str] = []
|
||||
values: list[Any] = []
|
||||
for key, value in fields.items():
|
||||
if key in json_fields and value is not None and not isinstance(value, str):
|
||||
value = json.dumps(value)
|
||||
sets.append(f"{key} = ?")
|
||||
values.append(value)
|
||||
|
||||
values.append(job_id)
|
||||
conn = _connect()
|
||||
try:
|
||||
conn.execute(
|
||||
f"UPDATE jobs SET {', '.join(sets)} WHERE id = ?",
|
||||
values,
|
||||
)
|
||||
conn.commit()
|
||||
finally:
|
||||
conn.close()
|
||||
|
||||
|
||||
def list_jobs(
|
||||
*,
|
||||
job_type: str | None = None,
|
||||
status: str | None = None,
|
||||
offset: int = 0,
|
||||
limit: int = 50,
|
||||
) -> dict[str, Any]:
|
||||
"""List jobs with optional filters, newest first."""
|
||||
limit = max(1, min(int(limit), 200))
|
||||
offset = max(0, int(offset))
|
||||
conn = _connect()
|
||||
try:
|
||||
clauses: list[str] = []
|
||||
params: list[Any] = []
|
||||
if job_type:
|
||||
clauses.append("job_type = ?")
|
||||
params.append(job_type)
|
||||
if status:
|
||||
clauses.append("status = ?")
|
||||
params.append(status)
|
||||
where = f"WHERE {' AND '.join(clauses)}" if clauses else ""
|
||||
total = conn.execute(
|
||||
f"SELECT COUNT(*) FROM jobs {where}", params
|
||||
).fetchone()[0]
|
||||
rows = conn.execute(
|
||||
f"SELECT * FROM jobs {where} ORDER BY created_at DESC LIMIT ? OFFSET ?",
|
||||
[*params, limit, offset],
|
||||
).fetchall()
|
||||
return {
|
||||
"items": [_row_to_dict(r) for r in rows],
|
||||
"total": total,
|
||||
"offset": offset,
|
||||
"limit": limit,
|
||||
}
|
||||
finally:
|
||||
conn.close()
|
||||
|
||||
|
||||
# ── Internal helpers ───────────────────────────────────────────────
|
||||
|
||||
_JSON_FIELDS = {"chunk_counts", "retrieved_chunks", "expansion_tree", "latency_breakdown",
|
||||
"token_usage", "document_tree", "benchmark_config",
|
||||
"questions", "per_question", "aggregate_metrics",
|
||||
"strategies_used"}
|
||||
"strategies_used", "payload", "result", "progress"}
|
||||
|
||||
|
||||
def _row_to_dict(row: sqlite3.Row) -> dict[str, Any]:
|
||||
|
||||
Reference in New Issue
Block a user