NLP Lab

NLP Lab RAG-QA Challenge

Leaderboard
Final
Submit
Submit

Data

Dataset Files

Download All

Dataset Details

1. Validation Dataset (50 examples)

  • File name: dev.jsonl
  • question: The question to answer
  • id: The question ID
  • reasoning_type: The reasoning category (contextual_single_hop, causal_chain, bridge_multi_doc, unanswerable, temporal_resolution, comparison_with_filtering, conflict_resolution, aggregation, bridge_multi_sentence)
  • evidence: The document and sentence references needed to answer the question, e.g. [{"doc_id": "", "sent_id": 1}]
  • answers: The gold answer label(s)

2. Test Dataset (1,000 examples)

  • File name: test.jsonl

3. Corpus Dataset (2,253 documents)

  • File name: corpus.jsonl

4. Submission Format

  • File name: sample_submission.jsonl

Dataset Format

Corpus rows contain a document ID, metadata, and sentence objects with stable sentence IDs.

RAG-QA test rows contain question inputs and stable IDs. The server validates submissions against the organizer test IDs.

{"doc_id":"doc_000001","sentences":[{"sent_id":1,"text":"..."}]}
{"id":"test_000001","question":"..."}

Submission

Submit exactly one JSONL prediction for every row in test.jsonl.

Each prediction must contain exactly id, answer, and evidence fields.

{"id":"test_000001","answer":"Mara Quinn","evidence":[{"doc_id":"doc_001542","sent_id":2}]}
{"doc_id":"doc_000001","sent_id":1}