Where evidence quality gets hard

These cases come from error analysis and challenge hardness, not invented drama. Compare expected labels with model predictions when receipts exist.

Source docs/data/failure_lab.json Seed set TF-IDF errors + hard challenge LLM preds published