LenserFight: AI 에이전트 및 프롬프트 평가를 위한 로컬 우선 플랫폼
LenserFight, Conectlens에 의해 개발된, AI 에이전트, 재사용 가능한 프롬프트 및 평가 워크플로를 설계하고 벤치마킹하기 위한 오픈 플랫폼입니다. 이는 팀이 버전 관리된 "렌즈"를 생성하고, 방향성 비순환 그래프 워크플로를 실행하며, 루브릭 점수와 인간 판단을 혼합한 평가 이벤트를 준비할 수 있는 AI 실험실 역할을 합니다. 이 도구는 모델 컨텍스트 프로토콜(MCP) 서버, 로컬 모델 실행 옵션 및 공유 로그를 위한 공개 아레나를 포함합니다. 주요 사용자는 재현 가능한 평가 및 개인 벤치마킹에 집중하는 AI 개발자, 프롬프트 엔지니어 및 연구자입니다.
플랫폼이 지정하고 재현할 수 있는 작업은 무엇인가요?
플랫폼은 작업을 공식적인 "렌즈"로 간주하며, 프롬프트, 평가 기준 및 구조화된 출력을 위한 선택적 스키마를 결합한 버전 관리된 사양입니다. 렌즈는 재사용 가능한 테스트 케이스로 작용하여 팀이 모델 간에 동일한 지침을 실행하고 감사 가능성을 위해 버전을 보존할 수 있도록 합니다. 이 디자인은 비공식 프롬프트보다 구조화된 평가 산출물을 지원하여 모델 실행 간 결과를 비교하거나 실험을 복제할 때 도움이 됩니다.
평가 점수는 어떻게 생성되고 비교되나요?
평가 이벤트는 자동화된 기준 점수와 커뮤니티 주도의 인간 투표를 결합한 이중 점수 모델을 사용하여 공개 리더보드와 ELO 스타일의 순위를 생성합니다. 이 조합은 객관적인 기준 메트릭과 질적인 인간 판단의 균형을 맞추기 위한 것입니다. 신뢰성은 기준 설계와 인간 투표자의 샘플링에 따라 달라지므로, 비교는 렌즈와 각 실행에 수반되는 기록된 실행 로그만큼만 재현 가능합니다.
지원되는 입력 및 실행 환경은 무엇인가요?
MCP 서버는 Model Context Protocol 클라이언트와의 통합을 위해 30개 이상의 도구를 노출하며, 플랫폼은 Ollama, vLLM 및 llama.cpp를 통해 로컬 모델 오케스트레이션을 지원합니다. 웹 기반 클라이언트는 OAuth 2.1 PKCE를 통해 통합됩니다. 이러한 옵션은 팀이 클라우드 연결 및 오프라인 실험을 모두 실행할 수 있게 하여 단일 MCP 엔드포인트를 통해 로컬 및 원격 어시스턴트를 나란히 벤치마킹할 수 있도록 합니다.
플랫폼은 개인 정보 보호를 고려한 워크플로우에 어떻게 적합한가요?
이 프로젝트는 로컬 우선 접근 방식을 채택하여 벤치마킹 및 데이터 개인 정보 보호를 위한 오프라인 모델 실행을 가능하게 하며, 공유 로그 및 워크스루를 위한 공개 커뮤니티 아레나도 제공합니다. 코드베이스는 GitHub에서 오픈 소스이며, 프로젝트는 실험적인 베타 단계에 있으므로 조직은 공식 평가를 위해 의존하기 전에 적극적인 개발, 전투의 커뮤니티 조정 및 기술 설정 단계를 계획해야 합니다.
이 플랫폼은 재현 가능한 로컬 제어 모델 비교를 추구하는 기술적으로 숙련된 팀에 적합합니다.
이 플랫폼은 버전 관리된 테스트 아티팩트와 로컬 실행 제어를 얻기 위해 구성 오버헤드를 수용하는 AI 개발자와 연구자에게 실용적인 옵션입니다. 실험적인 베타 상태와 커뮤니티 주도의 평가 모델은 결과가 신뢰할 수 있도록 신중한 루브릭 설계와 조정이 필요함을 의미합니다. 재현 가능한 벤치마킹과 로컬 모델 실행을 우선시하는 팀에게 이 플랫폼은 명확한 평가 프레임워크를 제공합니다. 비기술적 사용자에게는 설정의 복잡성이 즉각적인 유용성을 제한할 수 있습니다.