모호한 검색을 위한 벤치마크 프로젝트
🚀 프로젝트 소개
VibeSearchBench는 모호하고 다중 턴의 능동적인 검색을 위한 가장 어려운 벤치마크입니다. 200개의 장기 과제를 통해 사용자의 페르소나에 기반한 점진적 정보 공개를 평가하며, 검증 가능한 스키마 없는 지식 그래프 평가를 제공합니다.
✨ 주요 기능
- 200개의 다양한 검색 과제 제공
- 페르소나 기반의 점진적 정보 공개
- 검증 가능한 지식 그래프 평가 방식
🛠️ 기술 스택
이 프로젝트는 Python으로 개발되었으며, LLM(대형 언어 모델)을 활용하여 지식 그래프를 평가합니다.
💡 활용 방법
개발자는 이 프로젝트를 통해 능동적인 검색 에이전트를 개발하고, 다양한 검색 시나리오에서 성능을 평가할 수 있습니다.
📄 Original (English)
🔍 The hardest search benchmark in the wild — vague, multi-turn, proactive. 200 long-horizon tasks with persona-driven progressive disclosure, scored by verifiable schema-free knowledge-graph evaluation. No vibes, just triplet F1.
VibeSearchBench
Hardest — vague multi-turn proactive search in the wild. Verifiable — schema-free knowledge graph evaluation. Long-horizon — persona-driven progressive disclosure.
Leaderboard
Browse the full leaderboard and multi-turn task trajectories at vibebench.github.io/VibeSearchBench.github.io.
Evaluation:
- Primary metric: Triplet F1. Predicted knowledge graphs are matched against ground truth via LLM-as-judge node alignment and triplet semantic equivalence.
- Multi-turn interaction. Each task uses a persona-driven user simulator with progressive disclosure; agents may search, visit pages, and run code across many turns.
- Best reported score: 30.3 triplet F1 (Claude Opus 4.6, OpenClaw).
Tasks
200 tasks across 2 subsets and 20 domains. Each task pairs a vague initial query with a ground-truth knowledge graph.
| Split | Count | Description |
MIT License