CodeLab — Học lập trình thực chiến
Cuộc thi

Kỳ thi Olympic Trí tuệ Nhân tạo VAIO & IAIO là gì? Toàn tập Thể lệ, Khung đề thi & Đề mẫu chi tiết

Cẩm nang toàn diện về Kỳ thi Olympic Trí tuệ Nhân tạo Quốc gia (VAIO 2026) và Olympic Trí tuệ Nhân tạo Quốc tế (IAIO 2027 tại Đà Nẵng). Bao gồm thể lệ các vòng thi, khung chủ đề kiến thức, phân tích đề thi mẫu và lộ trình ôn luyện cho học sinh THCS, THPT.

VAIOIAIOTrí tuệ nhân tạoOlympic AIMachine LearningDeep LearningTHCSTHPTLập trình AI
Kỳ thi Olympic Trí tuệ Nhân tạo VAIO & IAIO là gì? Toàn tập Thể lệ, Khung đề thi & Đề mẫu chi tiết

Trong bối cảnh Trí tuệ Nhân tạo (Artificial Intelligence - AI) đang định hình lại toàn bộ nền kinh tế tri thức và công nghệ toàn cầu, việc đào tạo và tìm kiếm những tài năng trẻ xuất sắc trong lĩnh vực AI đã trở thành ưu tiên chiến lược của nhiều quốc gia.

Năm 2026–2027 đánh dấu một cột mốc lịch sử đối với phong trào học tập AI tại Việt Nam: Việt Nam chính thức đăng cai Vòng Chung kết Kỳ thi Olympic Trí tuệ Nhân tạo Quốc tế (IAIO 2027) tại thành phố Đà Nẵng, đồng thời phát động Kỳ thi Olympic Trí tuệ Nhân tạo Quốc gia (VAIO 2026) trên quy mô 63 tỉnh/thành phố để tuyển chọn 2 đội tuyển quốc gia tranh tài trên sân nhà.

Kỳ thi Olympic Trí tuệ Nhân tạo Quốc gia VAIO 2026 và Quốc tế IAIO 2027

Bài viết này tổng hợp toàn bộ thông tin quan trọng nhất: bối cảnh tổ chức, thể lệ thi đấu từng vòng, khung chương trình kiến thức khoa học, phân tích đề mẫu chính thức và chiến lược ôn luyện hiệu quả dành cho học sinh THCS, THPT, giáo viên và phụ huynh.


1. Tổng quan về Kỳ thi VAIO và IAIO

1.1. IAIO (International Artificial Intelligence Olympiad) là gì?

IAIO (International Artificial Intelligence Olympiad — Olympic Trí tuệ Nhân tạo Quốc tế) là kỳ thi học thuật đỉnh cao toàn cầu dành riêng cho học sinh phổ thông đam mê Trí tuệ Nhân tạo.

  • Lịch sử ra đời: Kỳ thi quốc tế được khởi xướng và tổ chức thành công lần đầu tiên vào năm 2024 tại Riyadh (Vương quốc Ả Rập Xê Út) dưới sự bảo trợ và phối hợp của:
    • Tổ chức Giáo dục, Khoa học và Văn hóa Liên Hợp Quốc (UNESCO).
    • Trung tâm Nghiên cứu AI Quốc tế (IRCAI) (thuộc bảo trợ của UNESCO loại 2, trụ sở tại Viện Jožef Stefan - JSI, Slovenia).
    • Hiệp hội Khoa học Máy tính Slovenia (ACM Slovenia).
  • IAIO 2027 tại Đà Nẵng: Kỳ thi quốc tế IAIO 2027 diễn ra từ ngày 25/02 đến ngày 02/03/2027 tại thành phố Đà Nẵng, Việt Nam. Dự kiến quy tụ khoảng 200 thí sinh xuất sắc đến từ hơn 50 quốc gia và vùng lãnh thổ, cùng 100 đại biểu, nhà khoa học hàng đầu thế giới.

1.2. VAIO (Vietnam Artificial Intelligence Olympiad) là gì?

VAIO (Vietnam Artificial Intelligence Olympiad — Olympic Trí tuệ Nhân tạo Quốc gia 2026) là kỳ thi quốc gia được tổ chức nhằm phát hiện, bồi dưỡng các tài năng AI trẻ của Việt Nam và tuyển chọn đại diện chính thức cho Đội tuyển Việt Nam tham dự IAIO 2027.

  • Cơ quan bảo trợ chính thức: Liên hiệp các Hội Khoa học và Kỹ thuật Việt Nam (VUSTA) theo Công văn số 754/LHHVN-KH&HTQT ngày 04/9/2026, cùng sự chỉ đạo phối hợp của UBND các tỉnh/thành phố (như UBND Tỉnh Hà Tĩnh qua Công văn số 9465/UBND-HCC2 và Sở GD&ĐT Hà Tĩnh qua Công văn 3608/SGDĐT-QLCL).
  • Đơn vị tổ chức chuyên môn:
    • Viện Nghiên cứu Đổi mới Sáng tạo & Kiểm định Chất lượng (RIVA).
    • Trung tâm Đổi mới Sáng tạo Quốc gia (NIC) (thuộc Bộ Kế hoạch và Đầu tư).
  • Website chính thức: https://www.iaio.vn (hoặc iaio.vn/vaio).

1.3. Hội đồng Khoa học Quốc gia của kỳ thi

Đề thi và chuẩn đánh giá của VAIO được chỉ đạo và thẩm định bởi Hội đồng Khoa học gồm các chuyên gia đầu ngành về AI tại Việt Nam:

  1. 1
    PGS.TS Đỗ Phan Thuận – Giảng viên cao cấp, Khoa CNTT, Viện phó Viện Chuyển đổi số, Trường ĐH Công Thương TP.HCM.
  2. 2
    TS. Trần Tiến Công – Trưởng khoa Trí tuệ Nhân tạo, Giám đốc Trung tâm đào tạo chuyên sâu về AI, Học viện Công nghệ Bưu chính Viễn thông (PTIT).
  3. 3
    TS. Đinh Viết Sang – Phó Hiệu trưởng Trường Công nghệ Thông tin và Truyền thông, Đại học Bách khoa Hà Nội (HUST).
  4. 4
    TS. Ngô Đức Thành – Trưởng khoa Khoa học Máy tính, Trường Đại học Công nghệ Thông tin, ĐHQG TP.HCM (UIT).
  5. 5
    TS. Ngô Văn Linh – Giảng viên Trường Công nghệ Thông tin và Truyền thông, Đại học Bách khoa Hà Nội.
  6. 6
    ThS. Phạm Đức Cường – Giảng viên Khoa AI, Giám đốc Trí tuệ Nhân tạo Meta Ecom Group.

2. Thể lệ và Lộ trình Tuyển chọn VAIO 2026 ➔ IAIO 2027

Hành trình dự thi hoàn toàn MIỄN PHÍ ở cả hai vòng thi quốc gia, mở cửa bình đẳng cho tất cả học sinh phổ thông trên mọi miền Tổ quốc.

Lộ trình các vòng thi Olympic Trí tuệ Nhân tạo VAIO 2026 và IAIO 2027

  1. 1
    Đăng ký dự thi (Từ tháng 7/2026): Mở cổng đăng ký trực tuyến miễn phí trên toàn quốc cho mọi học sinh THCS và THPT (cá nhân hoặc theo danh sách trường học).
  2. 2
    Vòng 1 - Sơ khảo toàn quốc (18/10/2026): Thi viết tập trung trên giấy (100 câu trắc nghiệm song ngữ Việt – Anh, thời lượng 180 phút) tại các điểm thi ở các tỉnh/thành phố để chọn ra Top 100 thí sinh có điểm số cao nhất.
  3. 3
    Vòng 2 - Chung kết Quốc gia (10/01/2027 tại Hà Nội): Top 100 thí sinh xuất sắc tranh tài trong một buổi thi thực hành Machine Learning liên tục trong 5 giờ trên máy tính cá nhân để giành các bộ Huy chương Vàng, Bạc, Đồng và giải thưởng quốc gia.
  4. 4
    Vòng Chung kết Quốc tế IAIO 2027 (25/02 – 02/03/2027 tại TP. Đà Nẵng): 8 thí sinh đạt Huy chương Vàng được vinh dự thành lập 2 đội tuyển đại diện nước chủ nhà Việt Nam (Đội 1 & Đội 2) thi đấu cùng hơn 200 tài năng AI trẻ đến từ 50 quốc gia trên thế giới.

2.1. Đối tượng và Điều kiện tham dự

  • Đối tượng: Toàn bộ học sinh bậc THCS và THPT đang học tập tại các trường ở Việt Nam.
  • Độ tuổi: Từ 20 tuổi trở xuống tính đến ngày 01/07/2027.
  • Kinh nghiệm: Không bắt buộc phải từng tham gia các kỳ thi tin học hay AI trước đó.
  • Lệ phí: 100% Miễn phí.

2.2. Vòng 1: Sơ khảo Toàn quốc (National Preliminary Round)

  • Thời gian: Chủ Nhật, ngày 18/10/2026, từ 09:00 đến 12:00 (180 phút).
  • Địa điểm: Các cụm điểm thi được bố trí tại các tỉnh/thành phố trên khắp 6 vùng kinh tế - xã hội của Việt Nam (Trung du miền núi phía Bắc, Đồng bằng sông Hồng, Bắc Trung Bộ, Duyên hải Nam Trung Bộ & Tây Nguyên, Đông Nam Bộ, Đồng bằng sông Cửu Long). Thí sinh thi gần địa bàn trường học của mình.
  • Hình thức thi: Thi viết trên giấy.
  • Cấu trúc bài thi: 100 câu trắc nghiệm (bao gồm dạng một đáp án đúng hoặc nhiều đáp án đúng).
  • Ngôn ngữ: Song ngữ Việt – Anh (thí sinh có thể đọc và trả lời bằng một trong hai ngôn ngữ).
  • Quy chế phòng thi:
    • Mang giấy tờ tùy thân hợp lệ (CCCD, Hộ chiếu hoặc Giấy tờ định danh có ảnh do nhà trường xác nhận) và bút.
    • Nghiêm cấm mang vào phòng thi: tài liệu, thiết bị liên lạc, internet hoặc thiết bị hỗ trợ AI.
  • Tiêu chuẩn đi tiếp: Top 100 thí sinh có tổng điểm cao nhất toàn quốc sẽ nhận thư mời trực tiếp từ Ban tổ chức vào Vòng 2.

2.3. Vòng 2: Chung kết Quốc gia (National Finals & Team Selection)

  • Thời gian: Ngày 10/01/2027.
  • Địa điểm: Thủ đô Hà Nội (tập trung trực tiếp).
  • Hình thức thi: Thi thực hành máy tính liên tục trong 5 giờ (300 phút).
  • Nội dung thực hành:
    • Thí sinh được cung cấp bộ dữ liệu thực tế (real-world datasets) và các bài toán phân tích, dự đoán.
    • Thí sinh tự lập trình xử lý dữ liệu, xây dựng và huấn luyện mô hình Machine Learning/Deep Learning trên máy tính cá nhân.
    • Tạo và nộp file dự đoán để hệ thống tự động chấm điểm trên tập kiểm thử ẩn (Hidden Test Set).
  • Quy định thiết bị:
    • Thí sinh tự trang bị máy tính xách tay cá nhân (Laptop) kèm sạc, đã cài sẵn môi trường lập trình (Python, IDE, thư viện ML/DL cơ bản như NumPy, Pandas, Scikit-learn, PyTorch, TensorFlow).
    • Không sử dụng: Internet (ngoại trừ cổng nộp bài thi nội bộ), không sử dụng Cloud Computing cá nhân (Google Colab, AWS, GCP ngoài tầm kiểm soát) và tuyệt đối cấm công cụ AI gợi ý sinh mã (như GitHub Copilot, ChatGPT, Claude,...). Mọi hành vi gian lận sẽ bị tước quyền thi ngay lập tức.

2.4. Cơ cấu Giải thưởng và Suất tuyển chọn Quốc tế

Kỳ thi Chung kết Quốc gia VAIO 2026 trao các hạng mục danh giá:

  • Huy chương Vàng (Gold Medal): Dành cho 8 thí sinh xuất sắc nhất.
  • Huy chương Bạc (Silver Medal): Dành cho nhóm thí sinh điểm kế tiếp.
  • Huy chương Đồng (Bronze Medal): Dành cho nhóm thí sinh tiếp theo.
  • Giải Khuyến khích & Giải Danh dự: Dành cho các thí sinh có thành tích tốt trong Top 100.

⭐ Đặc quyền nước chủ nhà IAIO 2027: Thông thường mỗi quốc gia chỉ được cử 1 đội (4 thành viên). Tuy nhiên, với tư cách là quốc gia đăng cai kỳ thi quốc tế tại Đà Nẵng, Việt Nam được quyền cử 2 đội tuyển (tổng cộng 8 thí sinh):

  • Đội tuyển Việt Nam 1: Gồm 4 thí sinh xếp hạng 1 đến 4 tại Vòng Chung kết Quốc gia.
  • Đội tuyển Việt Nam 2: Gồm 4 thí sinh xếp hạng 5 đến 8 tại Vòng Chung kết Quốc gia. Cả 8 thành viên sẽ được Ban Khoa học tổ chức huấn luyện chuyên sâu trước khi bước vào tranh tài tại IAIO 2027.

3. Khung Chương trình Kiến thức & Các Dạng Chủ đề Ra đề

Khung kiến thức chuẩn Olympic Trí tuệ Nhân tạo: Deep Neural Networks, Transformer Attention, Tensors và Đánh giá mô hình

Đề thi VAIO bám sát khung chương trình chuẩn mực do Ban Khoa học IAIO Quốc tế ban hành, kết hợp hài hòa giữa Nền tảng Toán học, Khoa học Dữ liệu, Mô hình Học máy và Tư duy Đạo đức AI.

Trọng tâmCác chủ đề chi tiết cần nắm vững
1. Toán học nền tảng cho AI- Đại số tuyến tính: Ma trận, vector, phép nhân ma trận, eigenvalues/eigenvectors, cosine similarity, tích vô hướng.<br>- Xác suất & Thống kê: Phân phối xác suất, xác suất có điều kiện (Bayes), kỳ vọng, phương sai, phân phối nhị thức, phân phối chuẩn.<br>- Giải tích & Tối ưu: Đạo hàm riêng, Gradient Descent, Stochastic Gradient Descent, hàm lồi, Chain Rule trong Backpropagation.
2. Học máy Cổ điển (Machine Learning)- Học có giám sát (Supervised): Tuyến tính (Linear/Logistic Regression), K-NN, Decision Trees, Random Forest, Gradient Boosting (XGBoost, LightGBM), Support Vector Machines (SVM).<br>- Học không giám sát (Unsupervised): K-Means, Hierarchical Clustering, PCA (Giảm chiều dữ liệu).<br>- Kernel Methods: Không gian đặc trưng phi tuyến, Kernel trick, định nghĩa khoảng cách trong không gian đặc trưng.
3. Học sâu (Deep Learning & Neural Networks)- Kiến trúc mạng cơ bản: Multi-Layer Perceptron (MLP), các hàm kích hoạt (ReLU, Sigmoid, Tanh, GELU, Softmax).<br>- Mạng tích chập (CNN): Convolution layer, Kernel/Filter, Stride, Padding, Pooling (Max/Average pooling), Feature maps, Weight sharing.<br>- Mô hình tuần tự & Transformer: Căn bản về Attention, Multi-Head Self-Attention, cơ chế mã hóa vị trí (Positional Encoding dạng sin/cos), Feed-Forward layers.
4. Tiền xử lý dữ liệu & Kỹ thuật đặc trưng- Xử lý giá trị khuyết (Missing value imputation), chuẩn hóa dữ liệu (Standardization, Normalization/MinMax).<br>- Mã hóa biến phân loại (One-Hot Encoding, Target Encoding).<br>- Xử lý dữ liệu mất cân bằng (Imbalanced dataset: SMOTE, Oversampling/Undersampling, Class Weights).
5. Đánh giá Mô hình & Thước đo (Evaluation Metrics)- Confusion Matrix (Ma trận nhầm lẫn): TP, TN, FP, FN.<br>- Precision, Recall, Specificity, F1-Score, ROC-AUC, PR-AUC, Macro/Micro Average.<br>- Distribution Shift (Dịch chuyển phân phối): Sự thay đổi của Precision/Recall khi phân phối nhãn π_dep ≠ π_train.<br>- Cost Matrix: Tối ưu hóa kỳ vọng tổn thất chi phí thay vì chỉ tối đa hóa độ chính xác thuần túy (Accuracy).
6. Đạo đức AI, An toàn & Thuật toán Ra quyết định- Quyền riêng tư vi phân (Differential Privacy - DP): Ngân sách riêng tư ε, quan hệ đánh đổi giữa bảo mật thông tin định danh (PII) và độ chính xác của LLM.<br>- Tính công bằng (Fairness), độ lệch (Bias) trong dữ liệu và mô hình AI.<br>- Bài toán ra quyết định: K-arm bandit problem (Exploration vs Exploitation).<br>- Thuật toán tìm kiếm & Tối ưu logic: Ứng dụng A* Search, thiết kế Heuristic Admissible và Monotonic (Consistent) cho các bài toán NLP (Word Ordering, SMT).

4. Phân tích Chi tiết 8 Câu hỏi Đề mẫu Chính thức (Sample Tasks)

Để giúp các bạn học sinh hình dung rõ nét độ sâu học thuật của đề thi, dưới đây là phân tích chi tiết 8 bài toán mẫu từ Vòng Chung kết Quốc tế IAIO (ban hành trên hệ thống iaio.vn), bao gồm cả dạng trắc nghiệm lý thuyết chuyên sâu và tự luận chứng minh thuật toán:


Task 1: Bài toán K-arm Bandit & Học tăng cường (Reinforcement Learning)

  • Đề bài: Trong bối cảnh bài toán k-arm bandit, thách thức cơ bản nhất mà thuật toán ra quyết định phải đối mặt là gì?
  • Các phương án:
    1. 1
      Xác định chuỗi hành động tối ưu trước khi khung thời gian đầu tiên bắt đầu.
    2. 2
      Cân bằng giữa việc khám phá các hành động chưa biết (Exploration) và khai thác các hành động đã biết có phần thưởng cao (Exploitation). (Đáp án đúng)
    3. 3
      Dự đoán phần thưởng của mỗi hành động sẽ thay đổi như thế nào theo thời gian.
    4. 4
      Giảm thiểu tổng số hành động được thực hiện trong khoảng thời gian T.
  • Phân tích: Đây là bài toán kinh điển của Học tăng cường (Reinforcement Learning). Điểm cốt lõi là sự đánh đổi giữa Exploration (Khám phá) – thử các cánh tay (hành động) chưa có nhiều thông tin để tìm kiếm cơ hội phần thưởng cao hơn, và Exploitation (Khai thác) – chọn cánh tay mà hiện tại ta tin rằng mang lại phần thưởng lớn nhất dựa trên dữ liệu đã thu thập.

Task 2: Kiến trúc Mạng nơ-ron Tích chập (Convolutional Neural Networks - CNN)

  • Đề bài: Phát biểu nào sau đây là ĐÚNG về tầng tích chập (Convolutional Layer)?
  • Các phương án:
    1. 1
      Kernel/mask của tầng tích chập là khoảng cách giữa các vùng tiếp nhận liền kề theo phương ngang hoặc dọc.
    2. 2
      Average pooling là một phép toán tích chập trong đó tất cả nơ-ron đều có trọng số có thể huấn luyện (trainable weights).
    3. 3
      Một tầng tích chập có thể có nhiều hơn một bản đồ đặc trưng (feature maps). (Đáp án đúng)
    4. 4
      Hai nơ-ron A và B trong cùng một bản đồ đặc trưng có trọng số khác nhau (W_A ≠ W_B).
  • Phân tích:
    • Phương án 1 sai: Khoảng cách giữa các vùng tiếp nhận là Stride, không phải Kernel/Mask.
    • Phương án 2 sai: Phép Pooling (Average hoặc Max) là phép toán cố định không có tham số học được (trainable weights).
    • Phương án 4 sai: Các nơ-ron trong cùng một feature map chia sẻ cùng một bộ trọng số (nguyên lý Weight Sharing của CNN).
    • Do đó phương án 3 đúng: Một tầng Convolution thường sử dụng nhiều bộ lọc (filters) khác nhau, mỗi filter trích xuất một khía cạnh đặc trưng riêng biệt và tạo ra một Feature Map riêng biệt.

Task 3: Đạo đức AI & Quyền riêng tư vi phân (Differential Privacy in LLMs)

  • Đề bài: Trong quá trình phát triển Mô hình Ngôn ngữ Lớn (LLM), nhóm kỹ sư áp dụng "Differential Privacy" (DP) như một ràng buộc thiết kế đạo đức để ngăn rò rỉ Thông tin Định danh Cá nhân (PII), thông qua tham số ngân sách riêng tư ε (privacy budget). Điều nào mô tả chính xác nhất tác động của ràng buộc này lên hiệu năng hệ thống?
  • Đáp án đúng: Luôn tồn tại một sự đánh đổi cố hữu (inherent trade-off): khi tăng mức độ đảm bảo tính riêng tư (tương ứng với việc giảm giá trị ε), độ chính xác (accuracy) và tốc độ hội tụ (convergence rate) của mô hình nhất thiết sẽ bị suy giảm.
  • Phân tích: Quyền riêng tư vi phân bảo vệ dữ liệu bằng cách cộng thêm nhiễu (noise) vào gradient trong quá trình huấn luyện (DP-SGD). Ngân sách ε càng nhỏ thì bảo mật càng cao (nhiễu cộng vào càng lớn), dẫn đến tín hiệu học tập của mạng bị suy hao, làm giảm chất lượng hội tụ và độ chính xác của LLM.

Task 4: Lý thuyết Học Thống kê (PAC Learning & Error Bound)

  • Đề bài: Cho tập hữu hạn X có kích thước k. Một thuật toán học A nhận tập mẫu S = ((x₁, y₁), ..., (xₘ, yₘ)) và trả về hàm dự đoán A(S) thỏa mãn:
    • Nếu x = xᵢ với i ∈ {1, ..., m} thì A(S)(x) = yᵢ.
    • Nếu x ∉ {x₁, ..., xₘ} thì A(S)(x) dự đoán ngẫu nhiên nhãn {0, 1} với xác suất 1/2. Chứng minh rằng đối với bất kỳ hàm mục tiêu f: X → {0, 1}, hiệu giữa sai số kỳ vọng trên toàn miền phân phối đều và sai số trên tập mẫu thỏa mãn:

    L₍U, f₎(A(S)) − L_S(A(S)) ≥ (k − m) / (2k)

  • Phân tích & Lời giải:
    • Trên tập mẫu S gồm m điểm phân biệt, mô hình ghi nhớ chính xác tuyệt đối các nhãn, do đó sai số thực nghiệm trên tập mẫu là L_S(A(S)) = 0.
    • Trên toàn bộ tập X (kích thước k), phân phối đều U gán trọng số xác suất 1/k cho mỗi phần tử:
      • Với m điểm đã thấy trong S, xác suất đoán sai bằng 0.
      • Với k − m điểm còn lại chưa từng xuất hiện trong S, mô hình đoán ngẫu nhiên nhãn với xác suất sai là 1/2.
    • Tổng sai số kỳ vọng:

      L₍U, f₎(A(S)) = ∑ (1/k) · P(A(S)(x) ≠ f(x)) = (m/k) · 0 + ((k − m)/k) · (1/2) = (k − m) / (2k)

    • Suy ra: L₍U, f₎(A(S)) − L_S(A(S)) = (k − m)/(2k) − 0 = (k − m)/(2k) (Đẳng thức đạt được, thỏa mãn bất đẳng thức ≥).

Task 5: Cơ chế Mã hóa Vị trí Sinusoidal trong Mô hình Transformer

  • Đề bài: Trong cơ chế Self-Attention của Transformer, vector vị trí PE tại vị trí pos được định nghĩa với mỗi chỉ số chiều i (0 ≤ i < d/2):

    PE(pos, 2i) = sin( pos / 10000^(2i/d) )
    PE(pos, 2i+1) = cos( pos / 10000^(2i/d) )
    Tính chất toán học nào sau đây là ĐÚNG với công thức này?

  • Đáp án đúng: Linear Translation (Tịnh tiến tuyến tính / Biến đổi quay): Với bất kỳ khoảng cách dịch chuyển cố định k, vector mã hóa tại vị trí pos + k có thể được biểu diễn dưới dạng một hàm biến đổi tuyến tính (phép quay ma trận) từ vector tại vị trí pos.
  • Chứng minh toán học: Đặt ωᵢ = 1 / 10000^(2i/d). Theo công thức cộng lượng giác:

    sin(ωᵢ(pos + k)) = sin(ωᵢ · pos) · cos(ωᵢ · k) + cos(ωᵢ · pos) · sin(ωᵢ · k)
    cos(ωᵢ(pos + k)) = cos(ωᵢ · pos) · cos(ωᵢ · k) − sin(ωᵢ · pos) · sin(ωᵢ · k)
    Biểu diễn dưới dạng phép nhân ma trận quay 2×2:

    [ PE(pos+k, 2i)   ]   [  cos(ωᵢ·k)   sin(ωᵢ·k) ] [ PE(pos, 2i)   ]
    [ PE(pos+k, 2i+1) ] = [ -sin(ωᵢ·k)   cos(ωᵢ·k) ] [ PE(pos, 2i+1) ]
    
    Ma trận quay này chỉ phụ thuộc vào khoảng cách tương đối k, giúp mô hình Transformer tự động suy ra mối liên hệ vị trí tương đối giữa hai từ bất kỳ trong câu.

Task 6: Đánh giá Phân loại Đa lớp khi có Dịch chuyển Phân phối (Distribution Shift) & Ma trận Tổn thất

  • Bối cảnh: Hệ thống phân loại thông điệp y tế khẩn cấp thành 3 mức độ: U (Khẩn cấp), S (Bán khẩn cấp), N (Không khẩn cấp).
  • Phân phối nhãn khi huấn luyện: π_train = (P(U) = 0.25, P(S) = 0.35, P(N) = 0.40).
  • Phân phối nhãn thực tế khi triển khai (Deployment): π_dep = (P(U) = 0.05, P(S) = 0.15, P(N) = 0.80).
  • Vấn đề cốt lõi thí sinh phải giải quyết:
    1. 1
      Tại sao Recall không đổi khi phân phối nhãn thay đổi, nhưng Precision lại thay đổi mạnh?
      • Recall của lớp U: Recall_U = P(pred=U | true=U). Điều kiện cố định theo nhãn thực tế nên không phụ thuộc vào tỉ lệ P(U) tổng thể trong tập dữ liệu.
      • Precision của lớp U: Precision_U = P(true=U) · P(pred=U | true=U) / P(pred=U). Theo định lý Bayes, tử số phụ thuộc trực tiếp vào tần suất tiên nghiệm P(U). Khi sang môi trường thực tế, tỉ lệ ca khẩn cấp P(U) tụt mạnh từ 25% xuống còn 5%, khiến Precision giảm sâu do số lượng cảnh báo sai (False Positives) từ lớp không khẩn cấp áp đảo.
    2. 2
      Tại sao chiến lược tối đa hóa Accuracy trong huấn luyện lại gây tổn thất lớn hơn chiến lược tối thiểu hóa chi phí kỳ vọng (Expected Cost)?
      • Ma trận chi phí phạt rất nặng lỗi bỏ sót ca cấp cứu: Dự đoán N khi thực tế là U bị phạt chi phí 100, trong khi đoán nhầm U khi thực tế là N chỉ tốn chi phí 1.
      • Nếu chỉ tối ưu hóa Accuracy trên tập dữ liệu mà 80% là nhãn N, mô hình sẽ có xu hướng thiên vị đoán nhãn N. Điều này dẫn đến việc bỏ sót các ca khẩn cấp U, gây tổn thất chi phí thực tế cực kỳ nghiêm trọng.

Task 7: Không gian Đặc trưng Nhân (Kernel Methods) & Phát hiện Bất thường (Novelty Detection)

  • Nội dung: Bài toán yêu cầu tính toán khoảng cách của một điểm dữ liệu x đến trọng tâm (Centre of Mass) c của tập dữ liệu huấn luyện S = {x₁, ..., xₘ} trong không gian đặc trưng Hilbert thông qua hàm nhân κ(x, z) = ⟨ϕ(x), ϕ(z)⟩:

    dist²(ϕ(x), c) = κ(x, x) − (2/m) ∑ κ(x, xᵢ) + (1/m²) ∑∑ κ(xᵢ, xⱼ)

  • Ứng dụng: Xây dựng thuật toán hình cầu bao nhỏ nhất (Minimum Enclosing Ball) để phát hiện mẫu dữ liệu lạ (Novelty/Outlier) và chứng minh giới hạn sai số phương pháp loại trừ một mẫu (Leave-One-Out Error).

Task 8: Tối ưu Trật tự Từ (Word Ordering) trong Dịch máy bằng Tìm kiếm A*

  • Bối cảnh: Cho túi từ W = {w₁, ..., w_N} và mô hình Bigram Language Model P(wⱼ | wᵢ). Cần tìm hoán vị π cực đại hóa xác suất câu bắt đầu bằng <S> và kết thúc bằng <E>.
  • Chuyển đổi bài toán: Cực đại hóa xác suất tương đương với cực tiểu hóa chi phí hàm logarit âm:

    C(u, v) = −ln P(v | u)

  • Phát biểu không gian trạng thái A*:
    • Trạng thái n: Cặp (w_last, U), trong đó w_last là từ vừa được xếp cuối cùng trong câu, và U ⊆ W là tập hợp các từ còn lại chưa được sử dụng.
    • Trạng thái bắt đầu: (<S>, W) với chi phí tích lũy g(start) = 0.
    • Trạng thái đích: (<E>, ∅).
    • Hàm kế tiếp (Successor): Chuyển từ (w, U) sang (u', U \ {u'}) với chi phí cộng dồn g(n') = g(n) − ln P(u' | w).
  • Thiết kế hàm Heuristic h(n) chấp nhận được (Admissible): Vì mỗi từ chưa đặt u ∈ U bắt buộc phải nhận một từ đi trước nó trong câu hoàn chỉnh, chi phí chuyển đến u không thể nhỏ hơn chi phí chuyển tiếp tốt nhất có thể:

    h(n) = ∑ min [ −ln P(u | v) ] (với v ∈ (W \ U) ∪ U ∪ {<S>}, v ≠ u) Hàm h(n) này là một cận dưới hợp lệ (h(n) ≤ h*(n)), đảm bảo tính Admissible và Monotonic (Consistent), giúp thuật toán tìm kiếm A* tìm ra đúng cấu trúc câu tối ưu mà không phải duyệt qua toàn bộ N! hoán vị.


5. Tài liệu Ôn thi & Nguồn Thực hành Khuyến nghị

Để chuẩn bị tốt nhất cho Vòng 1 (Trắc nghiệm song ngữ) và Vòng 2 (Lập trình thực tế), học sinh nên tập trung vào các nguồn tài liệu trọng điểm sau:

5.1. Bộ thử thách dữ liệu thực tế (IAIO Challenges)

Ban tổ chức IAIO đã công bố kho bài tập thực hành trên GitHub do chuyên gia Dimitar Mileski phụ trách:

  • Repository: https://github.com/dimitarmileski/IAIO-Challenges
  • Các bài toán mẫu:
    1. 1
      Dự đoán nồng độ khí CO₂ và chất ô nhiễm không khí: Sử dụng dữ liệu ảnh vệ tinh Sentinel-5P tại Nam Phi (Xử lý chuỗi thời gian, dữ liệu không gian).
    2. 2
      Dự đoán tài chính toàn diện (Financial Inclusion): Dự đoán xác suất người dân Đông Phi sở hữu tài khoản ngân hàng (Xử lý dữ liệu bảng dạng phân loại, mất cân bằng nhãn).
    3. 3
      Ước tính năng suất lúa (Crop Yield Prediction): Dự đoán sản lượng từ hơn 20 biến canh tác nông nghiệp ở bang Bihar, Ấn Độ (Bài toán hồi quy đa biến).

5.2. Khung tài liệu lý thuyết cần đọc

  1. 1
    Machine Learning Foundations: Khóa học kinh điển Machine Learning Specialization của Andrew Ng (DeepLearning.AI / Coursera).
  2. 2
    Deep Learning: Sách Dive into Deep Learning (d2l.ai) – cung cấp mã nguồn Python/PyTorch trực quan cho CNN, Transformers.
  3. 3
    Thực hành cạnh tranh: Nền tảng Kaggle và Zindi (luyện các bài toán Tabular Data, Computer Vision mức độ cơ bản/trung cấp).

6. Lộ trình Ôn luyện Đề xuất cho Học sinh Phổ thông

Giai đoạnMục tiêu & Nội dung chính
Giai đoạn 1: Xây nền (Tháng 6 - Tháng 8)- Ôn vững Đại số tuyến tính, Xác suất thống kê lớp 11-12.<br>- Học vững ngôn ngữ Python và các thư viện cốt lõi: numpy, pandas, matplotlib, scikit-learn.<br>- Hiểu bản chất các mô hình ML cơ bản (Linear Regression, Logistic, Decision Trees, K-Means, PCA).
Giai đoạn 2: Luyện sâu & Chiến lược Vòng 1 (Tháng 9 - Tháng 10)- Nắm vững mạng nơ-ron: Backpropagation, CNN, Attention, Positional Encoding.<br>- Ôn tập lý thuyết Đạo đức AI, Differential Privacy, Ma trận nhầm lẫn dưới Distribution Shift.<br>- Luyện phản xạ đọc hiểu đề trắc nghiệm Tiếng Anh học thuật (tốc độ ~1.8 phút/câu cho bài thi 100 câu 180 phút).
Giai đoạn 3: Nước rút Vòng 2 (Tháng 11 - Tháng 01)- Dành riêng cho thí sinh lọt Top 100 Vòng 1.<br>- Luyện kỹ năng Pipeline thực chiến: Làm sạch dữ liệu rác, Feature Engineering, tối ưu siêu tham số mô hình.<br>- Luyện thi áp lực thời gian (5 giờ liên tục) không có Internet, tối ưu hóa tốc độ chạy code cục bộ trên laptop cá nhân.

7. Tổng kết & Lời khuyên

Kỳ thi Olympic Trí tuệ Nhân tạo Quốc gia (VAIO 2026) và Olympic Quốc tế (IAIO 2027) tại Đà Nẵng không đơn thuần là một cuộc đua lấy huy chương, mà là bệ phóng giáo dục mang tầm vóc quốc tế cho thế hệ học sinh Việt Nam.

Kỳ thi đánh giá tư duy khoa học thực thụ: sự thấu hiểu bản chất toán học đằng sau các thuật toán, tư duy giải quyết vấn đề bằng dữ liệu thực và trách nhiệm đạo đức khi ứng dụng công nghệ AI vào đời sống.

Các trường học, phụ huynh và các bạn học sinh quan tâm nên chủ động theo dõi cổng thông tin chính thức tại https://www.iaio.vn để cập nhật thông báo về số báo danh, địa điểm thi của từng tỉnh thành và các tài liệu bổ trợ chính thức từ Ban Khoa học Quốc gia.