Dataset boundary
권한·라이선스·분할·누출·결측·기관 및 장비 분포를 집계 수준에서 확인합니다.
Autoresearch는 참가자의 로컬 Codex·Claude와 함께 공개 또는 명시적으로 승인된 데이터만 분석합니다. 문헌조사와 코드 반복을 줄이되, 숨은 시험데이터·개인 API 키·의료데이터를 Orcaton이나 외부 모델로 보내지 않습니다.
각 대회 화면의 키트에는 공개 과제·평가지표·출력 규격이 미리 들어갑니다. 데이터·숨은 정답·내부 평가 설정·로그인 정보는 포함되지 않습니다. SHA-256 checksum · Python 3.11+
Ranked case → tactic card → falsifiable experiment
의료영상 Kaggle 대회의 1·2·3등 공개 풀이에서 모델 성능을 더 끌어낸 법, 데이터를 더 깊게 본 법, 학습·검증을 영리하게 설계한 법, 상관성이 낮은 예측만 골라 앙상블한 법을 분리합니다. 새 대회에서 실제 신호가 맞는 카드만 최대 세 개 불러오며, 원문 근거·적용 조건·실패 조건·최소 반증 실험을 함께 남깁니다.
4
근거 기반 연구 스킬
≤3
한 제안에 불러오는 카드
PROPOSAL
실험 전 전술 상태
Inspect compiled problem/method context
python orcaton-autoresearch/scripts/orcaton_research.py method-context .Inspect remaining token budget
python orcaton-autoresearch/scripts/orcaton_research.py budget-status .권한·라이선스·분할·누출·결측·기관 및 장비 분포를 집계 수준에서 확인합니다.
현재 공개 방법을 원 논문·공식 벤치마크·저장소에 고정하고 직접 비교 가능성을 구분합니다.
여러 의료영상 Kaggle 대회의 1·2·3등 풀이에서 각 팀이 어떤 병목에 주목했고 왜 그 결정을 했는지 사례 카드로 정리합니다.
상위권의 연구 전술을 모델 활용·데이터 분석·학습 전략·앙상블 설계의 네 스킬로 분리하고 근거와 실패 조건을 붙입니다.
새 대회에서 관찰된 문제와 과거 상위권 팀의 관점을 연결해, 참가자 AI가 검증할 질문과 최소 실험을 제안합니다.
전처리, 구조, 목적함수, 추론, 계산량과 근거 공백을 같은 표에서 비교합니다.
관찰된 실패를 수학적 성질로 바꾸고 관련 방법 카드만 제한적으로 불러옵니다.
모델·프롬프트·연구 시드를 달리한 독립 제안을 만들되 모두 제안으로만 기록합니다.
성공 기준과 paired seed를 코드 수정 전에 잠그고 한 가설만 구현합니다.
결정론적 runner가 효과 구간, 실패와 하위집단 악화를 기록해 상태를 판정합니다.
사람이 결과를 검토한 뒤 코드와 데이터를 제외한 보고서·증거 ZIP을 만듭니다.
Local accounts or personal API · bounded campaign
기본 템플릿은 상위권 사례 유추·회의적 검토·실험 설계·고전 수학 및 신호처리 전이의 네 레인을 제공합니다. 사례 유추 레인은 참조한 대회·순위·원문과 새 문제의 대응점, 유추가 깨지는 조건을 반드시 남깁니다. 각 레인은 프롬프트와 연구 시드를 바꿀 수 있지만, 실제 성능은 별도로 잠근 paired seed 실험만 판정합니다. Orcaton에는 비밀번호·API 키·세션 쿠키가 저장되지 않습니다.
공식 ChatGPT OAuth 로그인 후 읽기 전용 제안 작업을 한 건씩 실행합니다.
codex login공식 Claude Code 로그인 후 plan 권한으로 구조화된 제안만 받습니다.
claude auth loginAPI 키는 참가자 환경변수에서만 읽습니다. 명시한 모델과 출력 토큰 한도로 한 작업씩 과금됩니다.
python orcaton-autoresearch/scripts/orcaton_research.py api-status1. Check local accounts
python orcaton-autoresearch/scripts/orcaton_research.py agent-status2. Freeze and inspect the matrix
python orcaton-autoresearch/scripts/orcaton_research.py campaign-plan .
python orcaton-autoresearch/scripts/orcaton_research.py campaign-status .3. Run one selected job
python orcaton-autoresearch/scripts/orcaton_research.py agent-run . --job-id JOB_ID4. Or run one API job
python orcaton-autoresearch/scripts/orcaton_research.py api-run . --job-id JOB_ID \
--max-output-tokens 2500API 키를 웹·캠페인 파일·명령 인자에 입력하지 않습니다. API는 고정된 공식 주소만 사용하며 자동 재시도하지 않습니다. 선택 기능인 로컬 stdio MCP는 상태 확인·안전한 프롬프트 렌더링·제안 기록만 제공합니다.
Open-data forward test
Project MONAI의 MedNIST 58,954장을 경로와 픽셀을 기록하지 않고 집계했습니다. 440개의 완전 중복과 공식 분할 부재를 발견해 중복 제거 후 5개 paired seed를 실행했습니다.
58,954
공개 JPEG
440
발견한 완전 중복
5/5
완료한 실험 쌍
+0.8144
균형 정확도 평균 차이
상수 예측 0.1667, 16×16 픽셀 로지스틱 회귀 0.9811. 이는 워크플로 검증이며 SOTA·숨은 시험셋·임상 성능 주장이 아닙니다. 환자 단위 식별자가 없어 실제 대회 분할 근거로 사용할 수 없습니다. MONAI source
Local workflow
압축을 참가자 프로젝트에 푼 뒤 상태 명령으로 다음 미완료 단계를 확인합니다. 업로드는 자동 실행되지 않습니다.
1. Initialize
python orcaton-autoresearch/scripts/orcaton_research.py init . \
--challenge-id CHALLENGE_ID \
--task "segmentation" --metric dice \
--direction maximize --minimum-effect 0.001 --seeds 72. Profile approved data
python orcaton-autoresearch/scripts/orcaton_research.py profile-data . -- \
--data-root /approved/data --dataset-id DATASET_VERSION \
--provenance OFFICIAL_URL --license SPDX_ID \
--unit-of-analysis image --modality CT \
--split-strategy "subject-grouped manifest v1" \
--label-process "approved labels" --data-classification PUBLIC3. Check progress
python orcaton-autoresearch/scripts/orcaton_research.py status .4. Lock the claim before editing
python orcaton-autoresearch/scripts/orcaton_research.py lock . \
--claim .orcaton-research/claims/CLAIM.json5. Run paired seeds
python orcaton-autoresearch/scripts/orcaton_research.py run . \
--claim .orcaton-research/claims/CLAIM.json6. Validate and package
python orcaton-autoresearch/scripts/orcaton_research.py finalize .