앤트그룹(Ant Group)이 기업용 AI 에이전트 워크플로우에 특화된 하이브리드 추론 모델 '링(Ling)-3.0-Flash'를 내놨다. 이 모델은 총 1240억 개(124B) 파라미터 중 토큰당 51억 개(5.1B)만 활성화해 연산 효율을 높인 것이 특징이다.
앤트그룹은 링-3.0-Flash가 2~3배 더 큰 규모의 경쟁 모델과 비교해 기본 추론, 지시 수행, 장문 처리 등 핵심 벤치마크에서 동등하거나 더 나은 성능을 보인다고 설명했다. 특히 'KDA(Kimi Delta Attention)'와 'MLA(Multi-head Latent Attention)' 레이어를 5:1 비율로 교차 배치한 네이티브 하이브리드 선형 어텐션 구조를 채택해 긴 문맥 처리 효율과 상태 메모리 유지 능력의 균형을 맞췄다.
KDA는 기존 Lightning Attention을 발전시킨 것으로, 델타 규칙 상태 업데이트에 세밀한 대각 게이팅을 도입해 장문 문서나 대규모 코드베이스 처리 시 중요한 정보를 더 정확히 유지한다. 전문가 활성화 비율은 이전 세대의 1/32에서 1/64로 줄여 효율을 높였고, 기본 256K 컨텍스트 윈도우를 지원하며 최대 1M 토큰까지 확장할 수 있다.
이 모델은 초대형 범용 추론 모델을 대체하기보다, AI 워크플로우에서 '계획-실행 분리' 패러다임을 완성하는 역할을 하도록 설계됐다. 깊은 사고가 필요한 계획은 대형 모델에 맡기고, 링-3.0-Flash는 비용을 통제하면서 빠르고 안정적으로 실행하는 노드로 기능한다는 것이다. 실제 에이전트 시나리오에 맞춰 1만 개 이상의 인터랙티브 환경에서 학습했으며, 자가 교정 기능과 장기 계획 수립 능력을 강화해 코딩, 작업 분해, 다중 소스 심층 조사 등 복잡한 과제를 자율적으로 처리한다.
속도와 안정성을 위해 클러스터 수준의 계층적 캐싱 시스템을 도입했다. 이는 긴 대화와 다중 턴 상호작용에서 중복 계산을 제거해 장문 입력의 첫 토큰 생성 시간(TTFT)을 60%에서 80% 이상 단축한다. 또한 업그레이드된 다중 에이전트 협업 아키텍처를 통해 서로 다른 에이전트가 분업하고 결과를 교차 검증함으로써 단일 모델의 오판 위험을 줄이고 고빈도 온라인 서비스를 지원한다.
링-3.0-Flash는 현재 OpenRouter와 Vercel AI Gateway에서 사용할 수 있으며, 2026년 8월 3일까지 무료 API로 제공된다. 무료 기간 종료 후에는 모델 가중치가 오픈소스로 공개될 예정이다.

