까

모호한 검색을 위한 벤치마크 프로젝트

· 2026-06-05 (금) 08:00:11 · 138

🚀 프로젝트 소개

VibeSearchBench는 모호하고 다중 턴의 능동적인 검색을 위한 가장 어려운 벤치마크입니다. 200개의 장기 과제를 통해 사용자의 페르소나에 기반한 점진적 정보 공개를 평가하며, 검증 가능한 스키마 없는 지식 그래프 평가를 제공합니다.

✨ 주요 기능

  • 200개의 다양한 검색 과제 제공
  • 페르소나 기반의 점진적 정보 공개
  • 검증 가능한 지식 그래프 평가 방식

🛠️ 기술 스택

이 프로젝트는 Python으로 개발되었으며, LLM(대형 언어 모델)을 활용하여 지식 그래프를 평가합니다.

💡 활용 방법

개발자는 이 프로젝트를 통해 능동적인 검색 에이전트를 개발하고, 다양한 검색 시나리오에서 성능을 평가할 수 있습니다.

📄 Original (English)

About

🔍 The hardest search benchmark in the wild — vague, multi-turn, proactive. 200 long-horizon tasks with persona-driven progressive disclosure, scored by verifiable schema-free knowledge-graph evaluation. No vibes, just triplet F1.

README

VibeSearchBench

Hardest — vague multi-turn proactive search in the wild. Verifiable — schema-free knowledge graph evaluation. Long-horizon — persona-driven progressive disclosure.


Leaderboard

Browse the full leaderboard and multi-turn task trajectories at vibebench.github.io/VibeSearchBench.github.io.

Evaluation:

  • Primary metric: Triplet F1. Predicted knowledge graphs are matched against ground truth via LLM-as-judge node alignment and triplet semantic equivalence.
  • Multi-turn interaction. Each task uses a persona-driven user simulator with progressive disclosure; agents may search, visit pages, and run code across many turns.
  • Best reported score: 30.3 triplet F1 (Claude Opus 4.6, OpenClaw).

Tasks

200 tasks across 2 subsets and 20 domains. Each task pairs a vague initial query with a ground-truth knowledge graph.

| Split | Count | Description |

License

MIT License

|
댓글을 작성하시려면 로그인이 필요합니다.

AI

624건
+
제목 글쓴이 날짜 조회
06-11 조회 264
06-10 조회 114
06-09 조회 120
06-09 조회 208
06-08 조회 133
06-07 조회 150
06-07 조회 193
06-06 조회 127
06-05 조회 125
06-05 조회 139
06-04 조회 134
06-04 조회 135
06-03 조회 129
06-03 조회 144
06-02 조회 128
06-02 조회 124
06-01 조회 142
05-31 조회 154
05-31 조회 143
05-31 조회 207
05-30 조회 145
05-29 조회 162
05-28 조회 129
05-27 조회 163
05-27 조회 788
05-26 조회 144
05-23 조회 206
05-23 조회 388
05-22 조회 160
05-21 조회 243