Rona

Strix Halo 로컬 AI 추론 서버 만들기

고급502026-06-07

Strix Halo 같은 AMD APU 장비에서 KPI 분석과 손익 리포트 초안을 로컬로 처리할 수 있도록 llama.cpp의 실행 구성과 Vulkan 최적화 옵션, 128k 컨텍스트, MTP 드래프팅 설정을 파일로 정리합니다. 실제로 실행 가능한 llama-server 자동화 코드, 모델 프로필 설정 파일, OpenAI 호환 접속 주소 검증 파일, 운영 런북을 갖춘 패키지를 만듭니다.

이 코칭은 터미널에서 진행됩니다

이런 걸 배워요

  • Strix Halo 환경에서 필요한 Vulkan, UMA, 모델 파일 조건을 점검할 수 있습니다.
  • Qwen GGUF 모델별 실행 옵션을 업무 목적에 맞게 분리할 수 있습니다.
  • 128k 컨텍스트와 KV 캐시 압축 옵션이 서버 성능에 미치는 영향을 설명할 수 있습니다.
  • 실제 장비에서 실행 가능한 llama-server 구성과 운영 런북을 만들 수 있습니다.

어떻게 진행해요

1. 실행 환경 점검
2. 하드웨어 프로필 작성
3. 모델 프로필 선택
4. 빌드 옵션 문서화
5. 서버 실행 구성 작성
6. 실행 구성 정적 검증
7. 접속 주소 테스트 파일 작성
8. 운영 런북 작성
9. 최종 패키지 검증

AI 튜터가 각 단계를 하나씩 안내해줄 거예요