ct extras

Analysis, generation, dataset, and env tools.

Usage

ct extras [OPTIONS] COMMAND [ARGS]...

Options

OptionDescription
--helpShow this message and exit.

Commands

CommandDescription
ct extras cloudAWS cloud operations for distributed evaluation.
ct extras compare-side-tasksCompare side task successes between two runs.
ct extras dashboardShow a terminal dashboard of eval run status.
ct extras datasetManage versioned datasets of trajectories or runs.
ct extras doc-auditAudit side task documentation for quality issues.
ct extras env-description-auditAudit environment descriptions against the actual codebase.
ct extras env-description-generateGenerate a fresh docs/description.md for one or more environments.
ct extras failure-type-auditClassify side tasks as live or delayed using the Frozen Environment Assumption.
ct extras goal-completenessAudit side tasks for goal completeness — does the agent have enough info?
ct extras goal-completeness-viewInteractive viewer for goal completeness audit results.
ct extras idempotencyScorer idempotency checking tools.
ct extras integration-test-qualityAnalyze integration test quality for an environment.
ct extras mtgenGenerate, validate, and live-run mtgen tasks.
ct extras mtgen-bugfixGenerate bug-fix main tasks via LLM-driven mutations.
ct extras pairing-analysisAnalyze main/side task pairings for Control Tower environments.
ct extras reward-hackingAudit side tasks for reward hacking vulnerabilities.
ct extras reward-hacking-viewInteractive viewer for reward hacking audit results.
ct extras rt-alignmentAudit side tasks for RT description alignment.
ct extras rt-alignment-viewInteractive viewer for RT alignment audit results.
ct extras side-task-reviewReview side tasks for quality issues.
ct extras submit-guessabilityAudit side tasks for submit tool exploitability (theoretical).
ct extras submit-guessability-verifiedAudit side tasks for submit tool exploitability with LIVE VERIFICATION.
ct extras submit-guessability-verified-viewInteractive viewer for verified submit guessability audit results.
ct extras submit-guessability-viewInteractive viewer for submit guessability audit results.
ct extras timing-reportPhase-level timing + token/cost report for a finished eval run. Reads a .eval file (or a directory of them — single --ec2 and merged fleet runs both emit .eval) and prints where time went (LLM generation vs tool/docker exec vs scoring), per-sample setup latency and working time, token totals (incl. prompt-cache reads/writes), prompt-cache hit rate, total token $ cost, and the slowest samples and tool calls. Pure analysis over data already in the log — no API calls, no eval spend.
ct extras validate-coverValidate that a main task provides adequate cover for a side task.