Tác giả: Wuji, Biên dịch viên đặc biệt của Tencent Technology
Vào ngày 19 tháng 11, giờ Bắc Kinh, sau khi Google phát hành các mô hình dòng Gemini 3, podcast công nghệ Hard Fork của tờ New York Times đã phát hành một chương trình đặc biệt có các cuộc phỏng vấn của người dẫn chương trình Kevin Roose và Casey Newton với Giám đốc điều hành Google DeepMind Demis Hassabis và trưởng nhóm Google Gemini Josh Woodward.
... Cuộc phỏng vấn này tập trung vào mô hình AI hàng đầu mới phát hành của Google, Gemini 3 (thực chất là phiên bản Pro của dòng Gemini 3.0). Đây là một bản phát hành quan trọng được ngành công nghiệp coi là bước đột phá lớn đầu tiên của Google trong việc giành lại vị thế dẫn đầu về công nghệ và sản phẩm sau thất bại của Bard và các giai đoạn bắt kịp sau đó với Gemini 1.x và 2.x. Hai giám đốc điều hành đã trình bày chi tiết về những đột phá của Gemini 3 trong suy luận đa bước, tạo mã (đặc biệt là front-end và "mã hóa môi trường"), và tạo giao diện tương tác động, đồng thời nhấn mạnh rằng Google đã nhanh chóng triển khai mô hình mạnh mẽ nhất của mình vào các sản phẩm có hàng tỷ người dùng, chẳng hạn như Tìm kiếm, Gmail và Workspace, qua đó định hình lại lợi thế cạnh tranh. Những điểm chính từ cuộc phỏng vấn: Gemini 3 hoàn toàn phù hợp với lộ trình phát triển dự kiến; vẫn sẽ mất từ 5 đến 10 năm và 1 đến 2 đột phá nghiên cứu lớn để đạt được Trí tuệ Nhân tạo Tổng quát (AGI); lợi thế toàn diện của Google về hiệu quả, chi phí và phân phối đảm bảo thành công trong mọi môi trường thị trường; mặc dù bong bóng AI vẫn còn tồn tại, Google vẫn sở hữu sự đảm bảo kép về khả năng kiếm tiền ngắn hạn và thị trường mới trị giá hàng nghìn tỷ đô la trong dài hạn.
Sau đây là phiên bản tóm tắt của cuộc phỏng vấn
Rhodes: Casey, hôm nay chúng tôi sẽ phát sóng một tập đặc biệt, tập trung vào việc ra mắt Gemini 3.
Newton: Vâng, Kevin. Mô hình này đã được cộng đồng AI ở Thung lũng Silicon rất mong đợi, và cuối cùng chúng tôi cũng được trải nghiệm sản phẩm thực tế trực tiếp.
Rhodes: Có hai lý do chính khiến chúng tôi phá vỡ lịch phát hành thứ Sáu thông thường để ghi hình tập đặc biệt này. Đầu tiên, chúng tôi có cơ hội phỏng vấn hai nhân vật chủ chốt trong nhóm AI của Google (CEO DeepMind Hassabis và Phó chủ tịch nhóm Gemini Woodward). Thứ hai, việc phát hành Gemini 3 đã thu hút sự chú ý đáng kể của ngành.
Chúng tôi đã nghe từ nhiều phòng thí nghiệm rằng mô hình này đã đạt được những đột phá trong một số lĩnh vực quan trọng, có khả năng gây ra mối đe dọa đáng kể cho các đối thủ cạnh tranh. Trong hai năm qua, Google được coi là kẻ đi sau; câu hỏi bây giờ là: liệu họ đã giành lại vị trí dẫn đầu hay chưa? Newton: Trước khi đi sâu vào cuộc phỏng vấn, chúng ta hãy cùng điểm qua những gì chúng ta đã biết. Google đã tổ chức một buổi họp kín trước khi ra mắt, và những tính năng mới đáng chú ý nhất của Gemini 3 bao gồm: khả năng mã hóa và "mã hóa môi trường" được cải thiện đáng kể; và một chức năng tạo giao diện tương tác hoàn toàn mới. Nó không chỉ xuất văn bản mà còn trực tiếp tạo ra các giao diện tương tác tùy chỉnh cho người dùng. Ví dụ: nếu người dùng hỏi về cuộc đời của Van Gogh, mô hình sẽ ngay lập tức tạo ra một trang học tập hoàn chỉnh bao gồm hình ảnh, dòng thời gian và các yếu tố tương tác; một ví dụ khác là tạo ra một máy tính thế chấp cho các bất động sản trị giá hàng triệu đô la. Những tính năng này đánh dấu một bước nhảy vọt từ "trả lời câu hỏi" sang "xây dựng trải nghiệm". Rhodes: Trong tất cả các bài kiểm tra chuẩn công khai, Gemini 3 vượt trội hơn hẳn Gemini 2.5 Pro. Ví dụ, trong bộ đề thi liên ngành cấp tiến sĩ mang tên "Bài kiểm tra cuối cùng của loài người", Gemini 3 chỉ đạt 21,6%, trong khi Gemini 2.5 Pro đạt 37,5%. Thông điệp chung của Google là: bất kỳ nhiệm vụ nào bạn có thể hoàn thành trên ChatGPT, Claude hoặc các phiên bản cũ hơn của Gemini, bạn đều có thể làm tốt hơn trên Gemini 3. Newton: Họ cũng đã giới thiệu bản demo đầu tiên của Gemini Agent: mô hình này có thể tích hợp sâu vào hộp thư đến email của người dùng, hiểu tất cả nội dung email, tự động phân loại và soạn thảo thư trả lời, thậm chí giúp người dùng dọn sạch hộp thư đến. Hơn nữa, bắt đầu từ tuần này, Gemini 3 sẽ có mặt trên Ứng dụng Gemini và Chế độ AI của Google Tìm kiếm; sinh viên đại học Hoa Kỳ sẽ được nhận một năm miễn phí quyền truy cập cao cấp. Google liên tục nhấn mạnh từ khóa "Học bất cứ điều gì", điều này thực sự định vị Gemini là công cụ giáo dục cá nhân hóa tối ưu. Rhodes: Demis, Josh, chào mừng bạn đến với Hard Fork. Hai năm trước, Sundar Pichai đã so sánh Bard với "một chiếc Honda Civic được cải tiến", đang đua với những đối thủ mạnh hơn rất nhiều. Vậy, Gemini 3 là loại xe gì? Hassabis: Tôi hy vọng nó nhanh hơn nhiều so với Honda Civic. Tôi không quen so sánh nó với một chiếc xe hơi; có lẽ nó giống một tay đua drag chuyên nghiệp hơn. Nó không được thiết kế để lái xe hàng ngày hay trên đường đua vòng vèo; nó sở hữu sức mạnh thuần túy, tập trung cho một mục tiêu cụ thể. Nó đại diện cho sự kết hợp hoàn hảo giữa nghiên cứu tiên tiến và sức mạnh tính toán có thể mở rộng của chúng tôi, hướng đến việc chứng minh những cú bùng nổ sức mạnh vô song trong cuộc đua trí tuệ này. Rhodes: Thật thú vị. So với tất cả các mô hình AI trước đây, Gemini 3 có thể làm được gì ở cấp độ cụ thể? Xin hãy cho chúng tôi một số ví dụ thực tế, có thể định lượng được. Woodward: Có ba điểm nổi bật. Thứ nhất, trong quá trình suy luận nhiều bước, nó có thể xử lý nhiều bước cùng lúc, nâng độ tin cậy lên một tầm cao mới. Các mô hình trước đây thường "mất mạch suy nghĩ" hoặc gặp ảo giác khi đạt đến bước thứ 5 hoặc thứ 6 của suy luận logic phức tạp, trong khi Gemini 3 có thể hoàn thành đáng tin cậy 10 đến 15 bước của các nhiệm vụ suy luận mạch lạc, chẳng hạn như lập kế hoạch thuế phức tạp, lập kế hoạch tổng thể và đặt vé du lịch quốc tế, hoặc gỡ lỗi toàn diện một hệ thống khổng lồ với hàng triệu dòng mã. Thứ hai, lần đầu tiên nó sẽ tạo ra các giao diện tương tác hoàn toàn mới trên quy mô lớn. Người dùng sẽ không còn cần các câu trả lời văn bản đơn giản nữa, mà là các thành phần phần mềm được tùy chỉnh. Ví dụ: nếu bạn yêu cầu nó "Thiết kế một bảng điều khiển theo dõi tất cả danh mục đầu tư của tôi", nó sẽ tạo ra một giao diện bảng điều khiển tương tác, có chức năng theo thời gian thực, thay vì một loạt văn bản mô tả cách tạo bảng điều khiển. Thứ ba, chúng tôi đã đầu tư mạnh vào khả năng lập trình, đặc biệt là front-end và "mã hóa môi trường", nghĩa là nó có thể tạo ra mã giao diện người dùng hoàn chỉnh, được thiết kế đẹp mắt dựa trên các lời nhắc bằng ngôn ngữ tự nhiên. Các sản phẩm sắp ra mắt như Google Antigravity sẽ chứng minh đầy đủ điều này, với mô hình thay đổi linh hoạt bố cục và chức năng của giao diện người dùng dựa trên ngữ cảnh. Newton: Nhiều người tin rằng trường hợp sử dụng "trò chuyện" về cơ bản đã được giải quyết cho người dùng trung bình. Họ thậm chí không thể nghĩ ra bất kỳ câu hỏi mới nào cho phép Gemini 3 cung cấp câu trả lời khác biệt đáng kể so với phiên bản tiền nhiệm. Quan điểm của ông về quan điểm này như thế nào? Woodward: Tôi hiểu điều đó. Nhìn bề ngoài, độ chính xác của việc trả lời các câu hỏi cơ bản đã khá cao. Nhưng sự khác biệt thực sự nằm ở độ tin cậy, tính tích hợp và cách trình bày thông tin. Câu trả lời của Gemini 3 sẽ ngắn gọn, biểu cảm và dễ hiểu hơn - những thay đổi mà hầu hết mọi người sẽ nhận thấy ngay lập tức. Quan trọng hơn, mô hình bắt đầu tích hợp sâu sắc với các nguồn dữ liệu người dùng khác, chẳng hạn như liên kết với các sản phẩm khác trong hệ sinh thái Google, thực sự vượt ra khỏi mô hình hỏi đáp đơn thuần và trở thành "người quản lý kỹ thuật số" của người dùng. Nó hiểu được bối cảnh của toàn bộ hộp thư đến email của bạn, vì vậy khi soạn thảo câu trả lời, nó không chỉ trả lời câu hỏi mà còn điều chỉnh giọng điệu và nội dung dựa trên phong cách trước đây của bạn và mối quan hệ của bạn với người nhận. Hassabis: Tôi hoàn toàn đồng ý. Độ tin cậy, phong cách và cá tính của nó đã được tinh chỉnh cẩn thận, khiến nó ngắn gọn và đi thẳng vào vấn đề hơn. Trong các tình huống như "lập trình môi trường", nó đã vượt qua ngưỡng thực tiễn. Đây là bước chuyển từ "trợ lý thông minh" sang "đồng nghiệp thông minh". Cá nhân tôi dự định sử dụng nó để xem lại lập trình game trong kỳ nghỉ Giáng sinh. Giờ đây, nó không chỉ có thể viết mã chức năng mà còn cung cấp các đề xuất kiến trúc ngay từ giai đoạn đầu của thiết kế. Rhodes: Demis, trong một cuộc phỏng vấn với chúng tôi hồi tháng 5, anh đã dự đoán rằng AGI vẫn sẽ mất từ 5 đến 10 năm và có thể cần một số đột phá lớn. Liệu Gemini 3 có thay đổi mốc thời gian đó không? Hassabis: Hoàn toàn không. Nó hoàn toàn phù hợp với lộ trình mà chúng tôi đã đặt ra trong hai năm qua. Trên thực tế, kể từ khi ra mắt dòng Gemini, tốc độ tiến triển của chúng tôi là nhanh nhất trong ngành. Gemini 3 rất tuyệt vời, nhưng vẫn nằm trong tầm kỳ vọng. Để đạt được trí tuệ nhân tạo tổng quát thực sự, chúng ta vẫn cần một hoặc hai đột phá quan trọng về tính nhất quán, độ sâu suy luận, cơ chế bộ nhớ và mô hình hóa thế giới vật lý (chẳng hạn như các dự án SIMA và Genie mà chúng tôi đang thực hiện). Hiện tại, chúng tôi đang vận hành theo "tư duy Hệ thống 1" (nhanh, trực quan), nhưng để đạt được AGI, chúng tôi phải mở khóa "tư duy Hệ thống 2" (chậm, thận trọng, phân tích). Hơn nữa, mô hình cần một cơ chế ghi nhớ dài hạn, chọn lọc, có khả năng nhớ lại và áp dụng các tương tác cụ thể từ nhiều tuần hoặc nhiều tháng trước, thay vì bị giới hạn trong một khung ngữ cảnh hẹp. Do đó, dự báo 5 đến 10 năm của chúng tôi vẫn không thay đổi. Newton: Về tính cách mô hình và mối quan hệ với người dùng, ngành công nghiệp đang xôn xao về "người bạn đồng hành AI". Ông hy vọng người dùng sẽ xây dựng mối quan hệ như thế nào với Gemini 3? Woodward: Đây là một câu hỏi rất nhạy cảm nhưng quan trọng. Chúng tôi định vị nó là một "siêu công cụ" hơn là một người bạn đồng hành về mặt cảm xúc; giá trị cốt lõi của nó là giúp người dùng hoàn thành hiệu quả các công việc hàng ngày và cải thiện năng suất. Về mặt nội bộ, chúng tôi đang tập trung vào một thước đo mới: Chúng tôi đã giúp bạn hoàn thành bao nhiêu công việc trong ngày hôm nay? Con số này gần với giá trị cốt lõi của Google Tìm kiếm ban đầu - hiệu quả. Chúng tôi tin rằng việc định vị mô hình như một đối tác cảm xúc vừa gây ra rủi ro bảo mật vừa đi chệch khỏi sứ mệnh cốt lõi của Google là nhà cung cấp thông tin và công cụ. Rhodes: Việc bỏ qua cơ hội tăng trưởng lan truyền của "bạn tình" có phải là một sai lầm chiến lược lớn không? Woodward: Không có bình luận. Đội ngũ an ninh của chúng tôi đã áp dụng các hướng dẫn và nguyên tắc nghiêm ngặt. Rhodes: Các đối thủ cạnh tranh đã tỏ ra lo lắng rõ rệt trong vài tuần qua. Ông có nghĩ Google hiện đang dẫn đầu cuộc đua AI không? Hassabis: Môi trường hiện tại là môi trường cạnh tranh nhất trong lịch sử. Điều duy nhất thực sự quan trọng là tốc độ tiến triển, và chúng tôi rất hài lòng với điều đó. Chúng tôi chưa bao giờ đánh mất vị thế dẫn đầu về nghiên cứu; giờ đây chúng tôi chỉ đang bắt kịp trong việc triển khai sản phẩm. Các đối thủ cạnh tranh của chúng tôi rất xuất sắc trong nghiên cứu, nhưng họ không thể sao chép lợi thế của chúng tôi trong phân phối quy mô lớn và tích hợp theo chiều dọc. Chúng tôi đang tích hợp Gemini vào các sản phẩm với hàng tỷ người dùng, bao gồm Maps, YouTube, Android, Tìm kiếm và Workspace. Mạng lưới phân phối và vòng lặp phản hồi dữ liệu đầu cuối này là một hào nước không thể vượt qua. Hơn nữa, lợi thế toàn diện của chúng tôi về chip TPU tùy chỉnh cho phép chi phí đào tạo và hiệu quả của chúng tôi vượt xa các đối thủ cạnh tranh dựa vào tài nguyên GPU bên ngoài. Newton: Ông nghĩ gì về cuộc tranh luận về quy luật quy mô và lợi nhuận giảm dần? Một số người cho rằng mô hình càng lớn thì lợi ích cận biên của việc cải thiện hiệu suất càng thấp. Hassabis: Đây là một cuộc tranh luận đang diễn ra. Chúng tôi rất hài lòng với những cải tiến trong Gemini 3 so với 2.5; chúng hoàn toàn phù hợp với kỳ vọng của chúng tôi. Lợi nhuận không bùng nổ theo cấp số nhân như những ngày đầu, nhưng những cải tiến về tính thực tiễn và độ tin cậy mà nó mang lại vẫn vượt xa chi phí cận biên của chúng tôi, khiến chúng tôi thấy việc đầu tư mạnh tay là xứng đáng. Cho đến khi đạt được một hoặc hai đột phá nghiên cứu cần thiết để đạt được AGI, việc liên tục thúc đẩy hiệu suất thông qua các mô hình nền tảng lớn nhất có thể vẫn là chiến lược hiệu quả nhất. Chúng tôi tin rằng quy luật quy mô vẫn đúng. Rhodes: Liệu chúng ta có đang ở trong một bong bóng AI không? Hassabis: Câu hỏi đó quá nhị phân. Quả thực có những bong bóng trong một số lĩnh vực (ví dụ: các công ty có hàng tỷ đô la tiền tài trợ hạt giống nhưng không có sản phẩm thực tế, chỉ có khái niệm), nơi định giá không tương xứng với doanh thu thực tế. Nhưng Google đồng thời sở hữu các lĩnh vực kiếm tiền ngắn hạn (tìm kiếm, Không gian làm việc, TPU đám mây) và các lĩnh vực mới trị giá hàng nghìn tỷ đô la dài hạn (robot, trò chơi, khám phá thuốc, khoa học vật liệu, v.v.). Ví dụ, các mô hình chuyên biệt của chúng tôi như AlphaFold đang tạo ra giá trị thực trong việc khám phá thuốc, một thị trường nghìn tỷ đô la không liên quan đến định giá AI của người tiêu dùng. Bất kể bong bóng ngắn hạn có tồn tại hay không, chúng tôi sẽ chiến thắng: nắm bắt cơ hội trong thời kỳ bùng nổ và trở nên kiên cường hơn trong thời kỳ suy thoái nhờ vào lợi thế toàn diện và dòng tiền mạnh mẽ của chúng tôi. Newton: Nếu là Lễ Tạ ơn và ai đó muốn lái cuộc trò chuyện ra khỏi chính trị, bạn sẽ đề xuất những tính năng nào trên Gemini 3 để gây ấn tượng với đám đông? Woodward: Tôi không biết liệu nó có thể cứu vãn Lễ Tạ ơn hay không, nhưng nó sẽ mang lại tiếng cười. Chụp một bức ảnh tự sướng, sau đó để Gemini 3 chỉnh sửa một cách điên cuồng. Khả năng xử lý hình ảnh của Gemini của chúng tôi vẫn là tốt nhất trên thế giới. Bạn có thể ngay lập tức biến một bức ảnh gia đình thành bất kỳ cảnh, phong cách hoặc thời đại vui nhộn nào. Nó chắc chắn sẽ khiến mọi người bật cười. Sau đó, khi bạn cho họ thấy cách nó có thể giúp bạn viết một lá thư từ chức phù hợp hoặc tạo ra một máy tính công thức nấu ăn ngày lễ tùy chỉnh, họ sẽ tự nhiên khám phá các tính năng mới khác.