Skip to content

[P0][E2E] Provar AgentHost + Runtime + Loop Hub instalados nas quatro superfícies do Code #319

Description

@wesleysimplicio

Parent: #315
Follow-up de: #50, #55, #121 e PR #312.

Problema

Há boa cobertura de protocolos/fake servers, mas o risco principal continua na composição instalada: AgentHost, Runtime, Loop Hub, Mapper/Fast, sockets/pipes, lifecycle, versões e quatro superfícies do Code. Fixtures in-process não comprovam instalação, discovery, segurança do endpoint, restart ou equivalência de efeito.

Objetivo

Entregar um harness E2E local reproduzível que instale/descubra componentes reais compatíveis e prove o fluxo usuário → Agent → Loop Hub/Runtime → diff/test → receipt em TUI, headless, ACP e workspace.

Caminho mais rápido

  1. Começar por um cenário mínimo CRUD determinístico, sem LLM local.
  2. Congelar versões/SHAs e usar provider remoto fake/fixture apenas para raciocínio.
  3. Reusar uma única workspace e executar as quatro superfícies contra os mesmos contratos.
  4. Depois adicionar concorrência, restart e tarefa Snake como sistema ampliado.
  5. Produzir uma matriz única comparável, não quatro relatórios diferentes.

Passo a passo

  1. Criar manifest de instalação com Code, Agent, Runtime, Loop, Mapper, Dev CLI e Fast.
  2. Validar binário, versão, checksum, capabilities e endpoint seguro de cada componente.
  3. Inicializar AgentHost e Runtime fora do processo Code, respeitando independência.
  4. Anexar Code a Loop Hub quando workflow/waves forem necessários.
  5. Executar scenario CRUD:
    • mapear projeto;
    • planejar alteração;
    • aplicar via Runtime;
    • executar testes;
    • produzir diff e receipts;
    • cancelar/reconciliar uma tentativa;
    • retomar sem efeito duplicado.
  6. Repetir em headless e ACP; automatizar TUI por PTY real.
  7. Exercitar workspace open/reopen e session rebuild.
  8. Repetir com Fast Rust, fallback Python explícito e Fast off, sem acesso direto a mmap.
  9. Executar duas instâncias simultâneas no mesmo workspace e em worktrees distintas.
  10. Reiniciar Agent/Runtime/Hub em pontos causais conhecidos.
  11. Testar N/N-1 e rejeição de versão incompatível.
  12. Provar que falta de Agent ou Runtime permite apenas diagnóstico.
  13. Adicionar cenário de jogo Snake após CRUD passar.
  14. Gerar receipt HBP e relatório Markdown com hashes.
  15. Tornar o harness chamável pela validação local da issue de CI.

Matriz mínima

  • superfície: TUI/headless/ACP/workspace;
  • SO: Linux/macOS/Windows suportado;
  • modo: cold/warm/restart;
  • Fast: rust/python/off;
  • endpoint: Unix socket/named pipe/loopback autenticado quando aplicável;
  • versão: N/N-1/incompatível;
  • resultado: success/failure/cancel/effect_unknown.

Evidência para fechar

Manifest instalado, checksums, transcripts redigidos, receipts, diffs, testes, matriz completa, tempos por etapa e falhas injetadas.

Execução

  • Implementar o objetivo descrito.
  • Fazer a implantação aplicável.
  • Executar e registrar os testes.

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Projects

    Status
    Backlog

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions