Hiện nay, những sản phẩm thử nghiệm AI hiện nay như ChatGPT Agent hay Comet vẫn còn nhiều hạn chế.
Giải pháp được chú ý là tạo ra môi trường - không gian mô phỏng cho tác nhân AI rèn luyện các tác vụ nhiều bước, được gọi là học tăng cường (RL). Tương tự như cách dữ liệu gắn nhãn từng thúc đẩy kỷ nguyên chatbot, môi trường RL đang trở thành một yếu tố quan trọng cho thế hệ AI mới.
Các quỹ đầu tư mạo hiểm, công ty khởi nghiệp và phòng thí nghiệm AI đều lao vào cuộc đua này. Andreessen Horowitz nhận định tất cả các phòng thí nghiệm lớn đều xây dựng môi trường RL nội bộ, đồng thời tìm kiếm đối tác bên ngoài.
Nhiều công ty mới như Mechanize, Prime Intellect đã gọi vốn lớn để phát triển nền tảng môi trường, trong khi các ông lớn gắn nhãn dữ liệu như Scale AI, Surge, Mercor cũng chuyển hướng đầu tư để không bị bỏ lại.
Một số thương vụ cho thấy sức nóng của xu hướng: Anthropic được cho là cân nhắc chi hơn 1 tỉ USD cho môi trường RL; Surge đạt doanh thu 1,2 tỉ USD năm ngoái nhờ hợp tác với OpenAI, Google, Meta; Mercor - định giá 10 tỉ USD.
Bản chất của môi trường RL là mô phỏng cách AI thao tác phần mềm, ví dụ một tác nhân được yêu cầu mua hàng trên Amazon và được chấm điểm theo kết quả. Công việc tưởng chừng đơn giản nhưng lại đòi hỏi môi trường đủ tinh vi để ghi nhận cả những hành vi bất ngờ. Chính điều này khiến RL phức tạp và tốn kém hơn nhiều so với dữ liệu tĩnh.
Trong khi cơ hội mở rộng RL còn gây tranh cãi, Thung lũng Silicon vẫn coi đây là một trong những hướng đi quan trọng để thúc đẩy tiến bộ AI, với kỳ vọng tái hiện làn sóng dữ liệu gắn nhãn từng tạo ra ChatGPT.