Benchmark·Public sample

HANDBOOK.md Agents

A long-context enterprise-agent benchmark built from unique RL environments with internal tools and external MCP servers.

Company-reportedConfidence: high·Last verified: 2026-08-16·How verification works
Access
Public / Open
Profile completeness 100%

What it is

HANDBOOK.md evaluates whether agents can follow a long company handbook while completing day-to-day professional tasks. Surge reports that each task is a unique RL environment across five enterprise domains.

Capabilities

Only evidenced capabilities are shown as Yes. Missing evidence remains Unknown.

StatefulUnknown
Long horizonYes
Multi-turnUnknown
Multi-agentUnknown
AdversarialUnknown
MultimodalUnknown
Tool useYes
Browser useUnknown
Computer useUnknown
Code executionUnknown
File manipulationUnknown
API interactionUnknown
MCP supportYes
SandboxedUnknown
Deterministic resetUnknown
Stochastic behaviorUnknown
Human in the loopUnknown
Expert authoredUnknown
SyntheticUnknown
Production derivedUnknown
Real application replicaUnknown
Partial observabilityUnknown
Persistent stateUnknown
Cross-applicationUnknown

Sources & provenance

  1. Surge AI · official · accessed 2026-08-16 · company-reported

Related artifacts

Benchmark

CoreCraft

Public sample

A simulated enterprise environment where agents complete customer-support and operational tasks inside a fictional PC retailer.

Surge · 100% completeCompany-reported