LLM

Aleph Alpha phát hành Kolibri: AI trọng số mở 78B, ngữ cảnh một triệu token và tham vọng chủ quyền châu Âu

Kolibri ra mắt ngày 03/10/2026 với 78,1 tỷ tham số, 3,46 tỷ kích hoạt mỗi token, Apache 2.0 và tool calling. Phân tích benchmark, phần cứng và giới hạn triển khai.

L
Lê Nghĩa
• • 👀 Đang tải...
Aleph Alpha phát hành Kolibri: AI trọng số mở 78B, ngữ cảnh một triệu token và tham vọng chủ quyền châu Âu
💡 Tóm tắt 30 giây (TL;DR)
  • ✓ Kolibri được phát hành ngày 03/10/2026: mô hình MoE tiếng Đức–Anh với 78,1 tỷ tham số tổng và 3,46 tỷ tham số hoạt động mỗi token.
  • ✓ Trọng số mở theo Apache 2.0, có reasoning và tool calling; hỗ trợ tối đa 1.048.576 token nhưng nhà phát triển khuyến nghị không quá 262.144 token cho tác vụ phức tạp.
  • ✓ Điểm mạnh là khả năng tự triển khai và hiệu quả tính toán; đây không phải mô hình 3B nhẹ về bộ nhớ, và benchmark công bố chưa phải kiểm chứng độc lập của AIDaLat.

Ngày 03/10/2026, nhân dịp Ngày Thống nhất nước Đức, Aleph Alpha phát hành Kolibri, một mô hình ngôn ngữ trọng số mở tập trung vào tiếng Đức và tiếng Anh. Mô hình sử dụng kiến trúc Mixture-of-Experts (MoE), có khoảng 78,1 tỷ tham số tổng, nhưng chỉ kích hoạt 3,46 tỷ tham số cho mỗi token. Trọng số được cung cấp trên Hugging Face theo giấy phép Apache 2.0.[1][2]

Điểm đáng chú ý không chỉ nằm ở cửa sổ ngữ cảnh lên tới một triệu token. Aleph Alpha định vị Kolibri cho những tổ chức muốn kiểm soát hạ tầng, dữ liệu và cách triển khai AI, đặc biệt trong hành chính công, công nghiệp và hàng không vũ trụ.[1]

Phạm vi bài viết: Tổng hợp tài liệu chính thức được truy xuất ngày 04/10/2026. Các điểm benchmark dưới đây do Aleph Alpha công bố; AIDaLat chưa chạy inference hoặc tái lập các phép đo trên GPU.

Kolibri có gì mới?

Theo model card, Kolibri là mô hình xử lý văn bản, hỗ trợ suy luận nhiều bước, lập trình, trích xuất có cấu trúc, hỏi đáp trên tài liệu bằng RAG và gọi công cụ trong workflow agent.[2]

Đặc điểmThông số công bố
Kiến trúcMoE Transformer, 50 lớp
Tham số tổng78.103.074.560
Tham số hoạt động mỗi token3.457.573.120
Ngôn ngữ tập trungTiếng Đức và tiếng Anh
Ngữ cảnh tối đa đã được nhà phát triển kiểm tra1.048.576 token
Ngưỡng ngữ cảnh khuyến nghịKhông quá 262.144 token
Chế độ reasoningnone, low, medium, high
Tool callingCó
Giấy phép trọng sốApache 2.0
Mốc kiến thức huấn luyện18/06/2026

Nguồn thông số: model card chính thức trên Hugging Face.[2]

78B tổng nhưng chỉ 3,46B hoạt động: tiết kiệm tính toán, không phải bộ nhớ

MoE cho phép mỗi token chỉ đi qua một phần các chuyên gia thay vì sử dụng toàn bộ tham số. Với Kolibri, mô hình có 384 chuyên gia định tuyến ở mỗi lớp, chọn 6 chuyên gia, cùng một chuyên gia dùng chung. Phần lớn lớp attention sử dụng cửa sổ trượt; một số lớp xử lý toàn bộ ngữ cảnh để cân bằng khả năng đọc tài liệu dài và chi phí.[2]

Tuy nhiên, 3,46B tham số hoạt động không có nghĩa Kolibri chạy được trên phần cứng của một mô hình dense 3B. Model card nhấn mạnh toàn bộ mô hình vẫn phải nằm trong bộ nhớ, với dung lượng trọng số FP8 khoảng 78 GB. Các cấu hình tối thiểu được liệt kê gồm 2 GPU A100 80 GB, 2 H100 SXM5 hoặc một H200, B200 hay B300.[2]

Bộ nhớ cho trọng số cũng chưa phản ánh toàn bộ chi phí phục vụ: ngữ cảnh và số yêu cầu đồng thời còn ảnh hưởng đến cấu hình triển khai. Vì vậy, khi đánh giá Kolibri, nên tách hai câu hỏi: tính toán cho mỗi token có hiệu quả không và hệ thống có đủ bộ nhớ để chứa mô hình cùng workload không?

Một triệu token: cần đọc kỹ phần khuyến nghị

Kolibri được huấn luyện ở các độ dài tăng dần: 16.384 token trong pre-training, 65.536 token trong mid-training và 262.144 token ở giai đoạn cuối mở rộng ngữ cảnh. Nhà phát triển gọi 262.144 token là độ dài ngữ cảnh native và cho biết đã kiểm tra chất lượng cùng hiệu quả phục vụ tới 1.048.576 token.[2]

Nhưng model card cũng khuyến nghị không quá 262.144 token cho triển khai nhạy về độ trễ, throughput hoặc tác vụ phức tạp.[2] Nói cách khác, thông số một triệu token là khả năng hỗ trợ, không phải lời bảo đảm rằng mọi bài toán đều nên đưa một triệu token vào prompt.

Góc nhìn AIDaLat: Với hệ thống hỏi đáp tài liệu doanh nghiệp, đây là lý do vẫn cần thử nghiệm chiến lược truy xuất, chọn đoạn và kiểm tra bằng chứng. Cửa sổ lớn không tự động thay thế thiết kế RAG tốt.

Benchmark: mạnh ở toán và code, nhưng không dẫn đầu mọi mặt

Trong bảng đánh giá do Aleph Alpha công bố, Kolibri đạt 96,9 trên AIME 2025, 96,0 trên AIME 2026, 84,3 trên GPQA Diamond tiếng Anh và 85,9 trên LiveCodeBench v6. Các kết quả này cho thấy mô hình đáng chú ý trong nhóm MoE có số tham số hoạt động nhỏ.[1][2]

Để tránh chỉ nhìn vào những hàng thuận lợi, có thể đối chiếu một số tác vụ khác trong cùng bảng của nhà phát triển:[2]

BenchmarkKolibriQwen3.6-35B-A3BNemotron 3 Super 120B-A12B
AIME 2026, tiếng Anh96,091,090,4
GPQA Diamond, tiếng Anh84,383,478,0
LiveCodeBench v685,982,582,0
SWE-Bench Verified66,473,860,2
BFCL v4 overall61,467,261,0

Nguồn: model card; đây là kết quả trong thiết lập đánh giá của Aleph Alpha, không phải phép đo trực tiếp của AIDaLat.[2]

Bức tranh khá rõ: Kolibri có điểm cao về toán và sinh code trong bảng này, nhưng không vượt Qwen3.6 ở SWE-Bench Verified hay BFCL v4 overall.[2] Vì thế, không nên suy từ một điểm toán cao sang kết luận “agent tốt nhất” hoặc “mô hình code tốt nhất”.

Aleph Alpha còn mô tả Kolibri nằm trên đường biên Pareto giữa chất lượng và chi phí phục vụ trong tập mô hình được so sánh.[1] Đây là tuyên bố có phạm vi: cần xem tập đối thủ, cấu hình phần cứng và cách tổng hợp điểm, thay vì diễn giải thành ưu thế tuyệt đối trên toàn thị trường.

“AI chủ quyền” ở đây có nghĩa gì?

Theo Aleph Alpha, Kolibri được xây dựng bởi các nhóm tại Đức và huấn luyện trên hạ tầng ở Đức cùng Phần Lan. Công ty nhấn mạnh quyền kiểm soát chuỗi phát triển, từ tuyển chọn dữ liệu tới pre-training, post-training và đánh giá; khách hàng có thể tự triển khai mà không phải gửi tài liệu nội bộ tới dịch vụ inference bên thứ ba.[1]

Kolibri cũng được huấn luyện để biết từ chối trả lời khi ngữ cảnh không có bằng chứng, thông qua dữ liệu abstention và giao thức Merlin-Arthur mà công ty mô tả trong tài liệu. Tuy nhiên, chính model card vẫn cảnh báo về lỗi, nội dung sai, thiên lệch và nhu cầu guardrail trong môi trường rủi ro cao.[1][2]

Cần phân biệt khả năng kiểm soát triển khai với sự tuân thủ tự động. Việc mô hình được phát triển có cân nhắc EU AI Act hoặc GDPR không thay thế đánh giá pháp lý, kiểm soát truy cập và trách nhiệm của hệ thống downstream. Model card yêu cầu triển khai phải đáp ứng quy định áp dụng và hướng tới quy trình có con người kiểm tra đầu ra, không phải agent hành động không giám sát.[2]

Trọng số mở không đồng nghĩa toàn bộ quy trình huấn luyện đều mở

Giấy phép Apache 2.0 trong kho Kolibri áp dụng cho trọng số và các tệp cấu hình được phát hành. Model card nói rõ giấy phép này không tự động mở rộng tới các thành phần khác không có trong kho, như mã và phương pháp huấn luyện.[2] Vì vậy, gọi Kolibri là mô hình trọng số mở — open-weight chính xác hơn việc mặc định toàn bộ dự án đều open source.

Cách bắt đầu với Kolibri

Nhà phát triển cung cấp package aleph-alpha-inference, tích hợp plugin Kolibri cho vLLM, cùng container ghcr.io/aleph-alpha/aleph-alpha-inference. Package sẽ cài phiên bản vLLM mà nó hỗ trợ.[2]

Trên môi trường Linux có GPU phù hợp, lệnh khởi động theo model card là:[2]

pip install 'aleph-alpha-inference>=1'

vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8 \
  --reasoning-parser kolibri1 \
  --tool-call-parser kolibri1 \
  --enable-auto-tool-choice

Máy chủ cung cấp API tương thích OpenAI. Mức reasoning được cấu hình qua chat template với reasoning_effort; có thể chọn low, medium, high hoặc tắt bằng none. Tham số lấy mẫu được nhà phát triển khuyến nghị là temperature=1.0, top_p=0.97 và top_k=128.[2]

Lưu ý thực hành: Đây là lệnh tham khảo từ tài liệu, chưa được AIDaLat chạy kiểm chứng. Hãy kiểm tra dung lượng GPU, phiên bản package và độ dài ngữ cảnh trước khi triển khai; không nên thử nguyên cấu hình này trên máy cá nhân thiếu VRAM.

Kolibri có ý nghĩa gì với cộng đồng AI Việt Nam?

Kolibri không được giới thiệu là mô hình tối ưu cho tiếng Việt: model card tập trung rõ vào tiếng Đức và tiếng Anh.[2] Với một ứng dụng phục vụ người Việt, không nên mặc định chất lượng ngôn ngữ và khả năng hiểu tài liệu địa phương chỉ từ benchmark tiếng Anh.

Điểm đáng học hỏi nằm ở chiến lược: tập trung vào ngôn ngữ và lĩnh vực cụ thể, cho phép tự triển khai, tối ưu số tham số hoạt động và để khách hàng điều chỉnh mức suy luận theo chi phí. Đây là một hướng phát triển khác với việc cố trở thành chatbot đa ngôn ngữ lớn nhất.

Kết luận: Kolibri bổ sung một lựa chọn trọng số mở đáng theo dõi cho hệ thống Đức–Anh, RAG và workflow có công cụ. Giá trị thực tế sẽ phụ thuộc vào chất lượng trên dữ liệu của tổ chức, chi phí vận hành và mức độ kiểm soát cần thiết — không chỉ vào con số 78B hay cửa sổ một triệu token.

Nguồn

Sources

[1] https://aleph-alpha.com/en/blog/kolibri-has-landed-a-sovereign-open-weight-model [2] https://huggingface.co/Aleph-Alpha/Kolibri-1

✉️ Bản Tin AI Hàng Tuần

Đón Đầu Bước Tiến Trí Tuệ Nhân Tạo

Nhận bản tóm tắt các mô hình AI mới nhất, bài hướng dẫn kỹ thuật độc quyền và mã nguồn mẫu được gửi thẳng vào hộp thư mỗi thứ Hai. Không spam, hủy bất kỳ lúc nào.

Được bảo vệ bởi Cloudflare Edge. Dữ liệu của bạn luôn an toàn.