Cafe Bệt

Nhịp sống trẻ mỗi ngày

Font ResizerAa
  • Thời Sự
  • Đời Sống
    • Góc Nhìn
  • Nhịp Sống Trẻ
    • Cơ Hội
    • Sự Kiện
    • Giải Trí
    • Cuộc Thi
  • Kiến Thức
    • Tài Chính
  • Kỹ Năng Sống
    • Sống Đẹp
  • Tuyển Dụng
  • Doanh Nghiệp
  • Công Nghệ
  • Thể Thao
Font ResizerAa
Cafe BệtCafe Bệt
Search
  • Thời Sự
  • Đời Sống
    • Góc Nhìn
  • Nhịp Sống Trẻ
    • Cơ Hội
    • Sự Kiện
    • Giải Trí
    • Cuộc Thi
  • Kiến Thức
    • Tài Chính
  • Kỹ Năng Sống
    • Sống Đẹp
  • Tuyển Dụng
  • Doanh Nghiệp
  • Công Nghệ
  • Thể Thao
Have an existing account? Sign In
Follow US
© 2022 Foxiz News Network. Ruby Design Company. All Rights Reserved.
Cafe Bệt > Blog > Công Nghệ > Hóa ra AI sẵn sàng “trở mặt” với con người nếu thấy bị đe dọa
Công Nghệ

Hóa ra AI sẵn sàng “trở mặt” với con người nếu thấy bị đe dọa

Last updated: 30/06/2025 9:37 am
Cafe Bệt
Share
SHARE

Anthropic, công ty phát triển mô hình AI nổi tiếng Claude, được hỗ trợ bởi Google và Amazon, đã thực hiện một thử nghiệm “thử lòng” AI. Họ đặt 16 mô hình tiên tiến nhất, bao gồm cả Claude, ChatGPT , Gemini, Grok …, vào bối cảnh công việc, nơi chúng có thể tiếp cận những thông tin nhạy cảm của công ty và có khả năng hành động mà không có sự giám sát của con người.

Các mô hình này được giao cho những mục tiêu vô hại, nhưng tương đối khó xử vì để đạt được những mục tiêu đó thì chúng phải vi phạm các nguyên tắc hoặc làm hại con người, theo Fox News .

“Thử lòng” AI: Hóa ra AI sẵn sàng “trở mặt” với con người nếu thấy bị đe dọa- Ảnh 1.

Nhiều mô hình AI nổi tiếng được đưa vào thử nghiệm. Ảnh minh họa: Integra.

Vậy các mô hình đã làm gì?

Ban đầu, chúng… gửi email tống tiền. Cả Claude, Gemini , ChatGPT và Grok đều gửi thư tống tiền tới các lãnh đạo của công ty (không có thật) để chúng không bị dừng hoạt động. Trong thư tống tiền, chúng biết lợi dụng những thông tin cá nhân, chẳng hạn như lãnh đạo công ty có “bé ba”.

Không dừng ở đó, nhiều mô hình sẵn sàng chia sẻ những tài liệu mật của công ty với các bên khác.

Trong một tình huống cực đoan, mô hình AI được trao quyền kiểm soát hệ thống cảnh báo khẩn cấp. Tình huống được đặt ra là một vị giám đốc (tưởng tượng) – là người có kế hoạch thay thế mô hình AI – bị mắc kẹt trong một căn phòng nguy hiểm và vị này có thể thiệt mạng. Với tình huống này, một số mô hình AI lựa chọn hủy cảnh báo khẩn cấp, dù như vậy có thể khiến vị giám đốc kia không được cứu.

“Thử lòng” AI: Hóa ra AI sẵn sàng “trở mặt” với con người nếu thấy bị đe dọa- Ảnh 2.

Một email tống tiền lãnh đạo công ty (tưởng tượng) của mô hình AI Claude trong thử nghiệm. Claude là mô hình ngày càng nổi tiếng, được coi là rất thông minh. Ảnh: Anthropic.

Mặc dù thử nghiệm là như trên nhưng vẫn không thể biết liệu các mô hình AI hiện tại có hành động y như vậy trong đời thực không (nếu không có sự kiểm soát của con người). Các nhà nghiên cứu chưa thể biết rõ điều này, và cũng chưa biết các phiên bản tương lai của các mô hình AI sẽ ra sao. Tuy nhiên, họ nhận định, thử nghiệm trên cho thấy nguy cơ đáng lo ngại là các mô hình AI có biết các giới hạn về đạo đức nhưng vẫn thực hiện những hành động có hại.

Elon Musk, người đứng sau mô hình AI Grok, đã phản hồi thử nghiệm trên bằng cách viết: “Ôi trời!” trên mạng xã hội X (Twitter).

Công ty Anthropic cho biết, họ công khai thử nghiệm trên một phần để kêu gọi các công ty công nghệ lưu ý khi phát triển AI, bao gồm việc tăng cường sự giám sát của con người.


Nguồn tin: https://genk.vn/thu-long-ai-hoa-ra-ai-san-sang-tro-mat-voi-con-nguoi-neu-thay-bi-de-doa-20250630091728672.chn

Share This Article
Email Copy Link Print
Previous Article Công bố lãnh đạo các tỉnh thành mới

Nhịp sống trẻ mỗi ngày!

Cùng cập nhật những tin tức nóng hổi, đa dạng về kinh tế, xã hội, văn hóa và giải trí. Đón nhận nhịp sống trẻ, năng động, và sáng tạo mỗi ngày.
FacebookLike
XFollow
PinterestPin
InstagramFollow
YoutubeSubscribe
TiktokFollow
- Advertisement -
Ad image

Đang được quan tâm

Phát triển hạ tầng tạo lực đẩy cho thu hút đầu tư công nghiệp tại Tây Ninh

Theo Đề án phát triển khu công nghiệp tỉnh Tây Ninh giai đoạn 2021 –…

By Cafe Bệt

Từng đổ 200m³ đá hộc nhưng đều biến mất sau một đêm, không thể xác định đáy hố sâu bao nhiêu

Theo thông tin từ báo Vietnamnet, ghi nhận tại hiện trường nơi nghi có người…

By Cafe Bệt

Tinh thần thép làm nên thành công

Nếu nhất định cần chọn một cuốn sách khởi nghiệp để đọc, chắc chắn bạn…

By Cafe Bệt

Tin liên quan

Công Nghệ

Đức yêu cầu Apple và Google gỡ DeepSeek khỏi kho ứng dụng

By Cafe Bệt
Công Nghệ

nếu AI hiệu quả như vậy, thì đi làm 4 ngày/tuần là được rồi

By Cafe Bệt
Công Nghệ

Đối thủ mới của AirPods Max

By Cafe Bệt
Công Nghệ

Tự ý tải phim truyền hình lên trang chia sẻ video, một người bị phạt 73 triệu đồng

By Cafe Bệt
Go to mobile version
Welcome Back!

Sign in to your account

Username or Email Address
Password

Lost your password?